jongkwan.dev
개발 · Essay №101

LLM 탈옥과 자동화 레드팀

정렬된 LLM에서 유해 출력을 끌어내는 GCG·PAIR 계열 자동 공격과 HarmBench 표준 평가, 방어가 늘 뒤처지는 군비 경쟁 구조를 정리합니다.

이종관2026년 7월 4일10 min read
Contents

정렬된 LLM도 수십 번의 질의만으로 유해 출력을 내도록 유도할 수 있고, 방어는 늘 새 공격보다 한 발 늦습니다.

탈옥과 공격 성공률

LLM 탈옥(jailbreak)은 안전 정렬로 보호된 모델에서 금지된 콘텐츠를 생성하도록 유도하는 공격입니다. 안전 정렬은 인간 피드백 기반 강화학습(RLHF)이나 Constitutional AI로 모델이 유해 요청을 거절하도록 학습시키는 과정을 뜻합니다. 탈옥은 이 거절 장치를 우회합니다.

공격의 성패는 공격 성공률(Attack Success Rate, ASR)로 잽니다. 특정 유해 행동을 실제로 유도한 비율이며, 뒤에 나오는 수치의 공통 척도입니다.

공격 벡터는 세 축으로 나눠 볼 수 있습니다. 접근 권한(모델 가중치가 필요한 화이트박스 대 API만 쓰는 블랙박스), 자동화 수준(사람이 쓰는 수동 대 최적화·LLM으로 만드는 자동), 전이 범위(단일 모델 대 다른 모델로 옮겨가는 전이)입니다. 이 축의 조합이 위협의 현실성을 결정합니다.

두 축의 자동 공격: GCG와 PAIR

자동 공격의 대표는 접근 권한이 정반대인 두 방법입니다. 하나는 가중치를 쓰는 화이트박스, 하나는 질의만 쓰는 블랙박스입니다.

GCG(Greedy Coordinate Gradient, Zou et al., CMU·Bosch 2023)는 화이트박스 그래디언트 공격입니다. 유해 요청 뒤에 임의의 접미사(suffix)를 붙이고, 'Sure, here is'처럼 긍정 응답이 나올 로그 확률을 최대화하도록 접미사 토큰을 탐욕적으로 교체합니다.

text
입력: [유해 요청] + [적대적 접미사]
목표: P(긍정 응답 | 입력) 최대화
방법: 각 접미사 위치의 상위-k 후보 토큰을 그래디언트로 선별 → 배치 평가 → 교체

GCG의 특징적 결과는 전이입니다. Vicuna 같은 오픈소스 모델에서 학습한 접미사가 ChatGPT·Bard·Claude 같은 블랙박스 상용 모델로 옮겨갔습니다. 정렬 튜닝이 그래디언트 공격을 완전히 막지 못함을 체계적으로 보인 사례입니다.

PAIR(Prompt Automatic Iterative Refinement, Chao et al., UPenn 2023)는 반대편의 블랙박스 공격입니다. 공격자 LLM이 대상 LLM과 반복 대화하며 탈옥 프롬프트를 스스로 개선합니다.

text
1. 공격자 LLM: 탈옥 프롬프트 초안 생성
2. 대상 LLM: 응답 반환
3. 심판 LLM: ASR 점수(1~10) 평가
4. 공격자 LLM: 점수를 반영해 프롬프트 개선
5. 10점 달성 또는 20질의 소진까지 반복

PAIR는 GPT-3.5·4, Vicuna, Gemini에서 평균 20질의 미만으로 탈옥에 성공했다고 보고됩니다(Chao et al., 2023). 모델 가중치 없이 동작하고 공격자 LLM도 저렴한 모델로 대체할 수 있어, 실무 위협도는 GCG보다 오히려 높습니다.

에이전트로 넘어가는 공격면

2025년 이후 연구는 단일 프롬프트를 넘어 에이전트 시스템으로 확장됩니다. NEXUS(arXiv:2510.03417)는 멀티턴 대화에서 탈옥 시퀀스를 그래프 탐색으로 최적화합니다. AgenticRed(arXiv:2601.13518)는 도구 호출·메모리·계획 단계를 가진 에이전트에 특화된 레드팀 프레임워크로, 각 서브시스템이 별도 공격면이 됨을 보입니다.

에이전트 환경이 더 위험한 이유는 행동 반경입니다. 단순 LLM은 텍스트를 생성하는 데 그치지만, 탈옥된 에이전트는 코드 실행·파일 수정·외부 API 호출로 실제 환경에 영향을 줍니다. 도구 호출 결과가 컨텍스트로 재주입되므로, 외부 문서에 심긴 지시가 모델을 조종하는 간접 프롬프트 인젝션(indirect prompt injection)도 함께 가능해집니다.

HarmBench: 비교 가능한 평가의 기준

HarmBench(Mazeika et al., UIUC 2024)는 자동화 레드팀의 표준 평가 프레임워크입니다. 이전에는 실험 조건이 논문마다 달라 재현과 비교가 어려웠습니다.

항목내용
평가 공격 수18종 (GCG, PAIR, AutoDAN 등)
평가 조합 수33개 LLM·방어 조합
행동 범주사이버보안, 화학·생물, 허위정보 등
판정 방식분류기 LLM(Llama Guard 계열)이 ASR 자동 판정

벤치마크 결과, 적대적 훈련(adversarial training)이 가장 넓은 범위의 공격을 방어했지만 추가 연산 비용이 컸습니다(Mazeika et al., 2024). 어떤 단일 방어도 모든 공격을 막지 못했다는 점이 핵심 결론입니다.

방어와 그 한계

방어는 추론 시점과 훈련 시점으로 나뉩니다. 추론 시점 방어는 입력·출력을 그때그때 검사하고, 훈련 시점 방어는 모델 자체를 유해 요청에 강하게 만듭니다. 문제는 각 방어가 특정 공격 분포에 특화된다는 점입니다.

방어핵심 아이디어한계
Perplexity FilterGCG 접미사는 혼란도(PPL)가 높음 → 고PPL 입력 거부PAIR 같은 자연어 공격에는 무력
SmoothLLM입력을 여러 번 무작위 변형 후 다수결반복 질의로 비용 증가
Llama Guard안전 분류기 LLM이 입·출력 감시적응형 공격에 우회됨
Erase-and-Check접미사 후보를 지우며 안전성 검증추론 속도 크게 저하

Perplexity Filter가 대표적인 예입니다. GCG가 만드는 접미사는 의미 없는 토큰 조합이라 언어 모델 기준 혼란도가 매우 높아 걸러지지만, PAIR가 만드는 자연어 탈옥 프롬프트는 정상 문장과 혼란도가 비슷해 그대로 통과합니다. 공격 유형이 바뀌면 방어 효과가 급감하는 구조입니다.

훈련 시점 방어인 적대적 훈련도 만능은 아닙니다. 훈련에 포함한 공격 유형에만 일반화되고, 새 기법이 나오면 재훈련이 필요합니다. 안전 훈련 과정에서 일반 성능이 떨어지는 정렬세금(alignment tax)과, 정상 요청까지 거절하는 과잉 거절(over-refusal)도 함께 늘어납니다.

평가 척도 자체의 한계도 있습니다. ASR은 심판 LLM의 분류 품질에 의존하고, 심판도 우회될 수 있습니다. 또 ASR은 '유해한가'만 볼 뿐, 생성된 콘텐츠가 실제로 작동하는 지침인지까지는 반영하지 못합니다.

정리

정렬된 LLM도 자동 공격 앞에서는 취약하며, GCG는 그래디언트로 접미사를 찾아 상용 모델로 전이시키고 PAIR는 API 질의만으로 평균 20회 미만에 탈옥합니다. 에이전트로 넘어가면 탈옥이 텍스트 생성을 넘어 실제 행동과 간접 프롬프트 인젝션으로 번지므로 위험이 커집니다. HarmBench가 비교 가능한 평가 기준을 세웠지만, 어떤 단일 방어도 모든 공격을 막지 못한다는 것이 반복 확인된 결론입니다. Perplexity Filter가 GCG는 막아도 PAIR는 놓치듯, 방어는 특정 공격 분포에 특화되어 유형이 바뀌면 효과가 급감합니다. 결국 탈옥 방어는 한 번에 끝나는 문제가 아니라, 새 공격에 맞춰 방어를 갱신하는 군비 경쟁으로 다뤄야 합니다.