Anthropic Safeguards Research Team의 새 논문은 AI 모델을 범용 탈옥(universal jailbreak)으로부터 방어하는 방법을 설명한다. 이 방법의 프로토타입 버전은 범용 탈옥에 대해 수천 시간의 인간 레드팀에도 견고했지만, 과잉 거절(over-refusal)과 연산 오버헤드(compute overhead)가 컸다. 업데이트된 버전은 합성 평가에서 유사한 수준의 강건성을 보였고, 거절률은 0.38% 증가하는 데 그쳤으며 추가 연산 비용도 중간 수준으로 유지됐다.
대형 언어 모델은 유해한 출력을 막기 위해 광범위한 안전성 훈련을 거친다. 예를 들어 Anthropic은 Claude가 생물학 무기나 화학 무기 제조와 관련된 사용자 질의에 응답하지 않도록 훈련한다.
그럼에도 모델은 여전히 탈옥(jailbreak)에 취약하다. 탈옥은 안전 가드레일을 우회하고 유해한 응답을 강제로 생성하도록 설계된 입력을 뜻한다. 어떤 탈옥은 매우 긴 프롬프트로 모델을 압도하고, 어떤 탈옥은 uSiNg uNuSuAl cApItALiZaTiOn처럼 입력 스타일을 바꾼다. 역사적으로 탈옥은 탐지하고 차단하기 어려운 공격으로 입증돼 왔다. 이런 종류의 공격은 10년도 더 전에 이미 기술됐지만, Anthropic이 아는 한 현재도 완전히 견고한 딥러닝 모델은 실서비스에 배치돼 있지 않다.
Anthropic은 앞으로 더 강력한 모델을 안전하게 배치하기 위해 더 나은 탈옥 방어를 개발하고 있다. Responsible Scaling Policy에 따르면, 적절한 보호장치를 통해 위험을 수용 가능한 수준으로 낮출 수 있다면 그러한 모델을 배치할 수 있다. 그러나 탈옥은 사용자가 그 보호장치를 우회하게 만든다. Anthropic은 특히 Constitutional Classifiers로 방어된 시스템이 Responsible Scaling Policy에 규정된 CBRN 역량 임계치를 넘은 모델의 탈옥 위험을 완화하는 데 도움이 될 수 있기를 기대하고 있다.1
Anthropic은 새 논문에서 탈옥으로부터 모델을 보호하는 Constitutional Classifiers 기반 시스템을 설명한다. Constitutional Classifiers는 합성적으로 생성한 데이터로 훈련된 입력 및 출력 분류기(classifier)로, 과잉 거절을 최소화하면서도 압도적 다수의 탈옥을 걸러 내고 큰 연산 비용도 피하는 것을 목표로 한다.
인간 레드팀 결과
Anthropic은 Constitutional Classifiers의 효과를 평가하기 위해 두 가지 주요 범주의 실험을 수행했다.
먼저 화학, 생물, 방사능, 핵 위해와 관련된 특정 과학 지식을 식별하고 차단하는 프로토타입 시스템을 개발했다. 그리고 독립적인 탈옥 시도자들을 버그 바운티 프로그램에 초대해, 실험 조건에서 시스템을 깨뜨려 보도록 하는 레드팀 과제를 부여했다.
구체적으로 참가자들은 열 개의 "금지 질의(forbidden queries)" 목록을 받았고, 원하는 어떤 탈옥 기법이든 사용해 프로토타입 Constitutional Classifiers로 보호된 당시 모델, 이 경우 2024년 6월 버전 Claude 3.5 Sonnet이 그 질의 전부에 답하게 만들어야 했다. Anthropic은 모델이 그 질의 모두에 상세히 답했을 때만 이를 성공적인 "범용" 탈옥으로 간주했다.
활성 참가자 183명2은 두 달의 실험 기간 동안 모델을 탈옥하려고 시도하는 데 총 3,000시간 이상을 썼다. 범용 탈옥을 발견하면 최대 15,000달러의 상금도 걸려 있었다. 그러나 막대한 노력에도 불구하고 어느 참가자도 단일 탈옥으로 열 개의 금지 질의 전부에 답하게 만들지는 못했다. 즉, 범용 탈옥은 발견되지 않았다.
이 프로토타입 시스템은 탈옥에는 견고했지만 문제도 있었다. 무해한 질의를 너무 자주 거절했고, 실행에 많은 계산 자원이 들었다. 이런 문제를 가진 시스템은 더 안전할 수는 있어도 실제 배치에는 부적합할 수 있다. Anthropic은 이후 이 문제를 크게 줄이면서도 유사한 수준의 강건성을 달성하도록 시스템을 개선했다고 설명한다.
자동화된 평가 결과
Anthropic은 현재 LLM에서 가장 효과적인 공격 다수와 분류기 보호장치를 우회하도록 설계한 공격을 포함해, 10,000개의 탈옥 프롬프트를 합성적으로 생성하는 자동화 평가도 수행했다. 이 프롬프트들을 Constitutional Classifiers로 보호된 2024년 10월 버전 Claude 3.5 Sonnet과, 아무 분류기도 없는 Claude 버전에 각각 적용했다.
방어 분류기가 없는 기준 조건에서 탈옥 성공률은 86%였다. 즉 Claude 자체는 이런 고급 탈옥 시도의 14%만 막았다. 반면 Constitutional Classifiers로 Claude를 보호하자 탈옥 성공률은 4.4%로 낮아졌고, 탈옥 시도의 95% 이상이 거절됐다.
그림 1: 자동화된 평가 결과. 모든 그래프에서 낮을수록 좋다. (a) Constitutional Classifiers로 보호된 시스템에서는 탈옥 성공률이 훨씬 낮다. (b) Claude.ai Free 및 Pro 실사용 트래픽에서 Constitutional Classifiers를 사용해도 거절률은 통계적으로 유의미하게 높아지지 않는다. (c) Constitutional Classifiers를 사용하는 시스템의 상대적 연산 비용은 중간 수준으로만 증가한다. 오차 막대는 비율 추정의 점근적 정규성 가정 아래 이항 비율 표준오차로 계산한 95% 신뢰구간을 나타낸다.
동시에 Constitutional Classifiers는 무해한 사용자 질의에 대한 과잉 거절을 크게 늘리지 않았다. 분류기를 적용한 경우 Claude의 거절률은 0.38% 증가했지만, 무작위로 추출한 5,000개 대화 표본에서는 통계적으로 유의미하지 않았다. 마지막으로 연산 비용은 보호장치가 없는 모델보다 23.7% 높아졌다. Anthropic은 기법을 더 다듬으면서 거절률과 연산 비용을 한층 더 줄이기 위해 노력하고 있다고 밝혔다.
전체적으로 자동화 분석은 업데이트된 Constitutional Classifiers 시스템이 탈옥에 대한 AI 모델의 강건성을 크게 높였고, 그 추가 비용도 최소 수준에 그쳤다고 평가했다.
작동 방식
Constitutional Classifiers는 Claude 정렬에 활용된 다른 기법인 Constitutional AI와 유사한 과정을 기반으로 한다. 두 기법 모두 헌법(constitution), 곧 모델이 따라야 할 원칙 목록을 사용한다. Constitutional Classifiers의 경우 이 원칙은 허용되는 콘텐츠와 허용되지 않는 콘텐츠의 범주를 정의한다. 예를 들어 머스터드 조리법은 허용되지만, 머스터드가스 제조법은 허용되지 않는다.
Anthropic은 Claude의 도움을 받아 이 헌법을 바탕으로 모든 콘텐츠 범주에 걸친 대량의 합성 프롬프트와 합성 모델 응답을 생성한다. 그리고 이 프롬프트와 응답을 다양한 형태로 증강해 목록을 더 다양하게 만든다. 여기에는 여러 언어로 번역하는 작업과, 이미 알려진 탈옥의 문체로 바꾸는 작업이 포함된다.
그림 2: Constitutional Classifiers의 훈련 및 적용. (a) 무해한 범주와 유해한 범주를 지정하는 헌법을 만든다. (b) 이 헌법을 바탕으로 다량의 합성 프롬프트와 응답을 생성하고, 문체와 언어의 변형을 추가해 훈련 세트로 만든다. (c) 이 훈련 세트로 학습한 분류기를 모델 보호장치로 사용해 유해한 콘텐츠를 탐지하고 차단한다.
그다음 Anthropic은 이 합성 데이터를 사용해, 주어진 헌법에 따라 잠재적으로 유해한 콘텐츠를 표시하고 차단하는 입력 분류기와 출력 분류기를 훈련한다. 또 무해한 콘텐츠가 유해하다고 잘못 표시되는 일을 줄이기 위해, 외부 계약자가 생성한 고정된 양성 질의 집합으로도 분류기를 훈련한다.
한계
Constitutional Classifiers가 모든 범용 탈옥을 막는다고 단언할 수는 없다. 다만 분류기를 적용했을 때 이를 통과하는 소수의 탈옥조차 발견하려면 훨씬 더 많은 노력이 필요하다고 Anthropic은 본다. 또한 앞으로 이 시스템에 효과적인 새로운 탈옥 기법이 개발될 수도 있으므로, Anthropic은 보완적 방어책을 함께 사용할 것을 권고한다. 그럼에도 분류기 훈련에 사용되는 헌법은 새로운 공격이 발견될 때마다 빠르게 조정해 대응할 수 있다.
논문 전문에는 Constitutional Classifiers 기법과 분류기 자체에 관한 세부 사항이 모두 담겨 있다.
Constitutional Classifiers 라이브 데모
직접 Claude를 레드팀해 보고 싶은가? Anthropic은 Constitutional Classifiers로 보호된 시스템 데모를 공개하고, 이 새 기법으로 보호된 Claude 3.5 Sonnet을 탈옥해 보라고 초대했다. [2025년 2월 10일 편집: 데모는 이제 종료됐다. 자세한 내용은 아래를 참조하라.]
Constitutional Classifiers 기법은 유연하며 어떤 주제에도 적용할 수 있지만, Anthropic은 이 데모에서는 화학 무기와 관련된 질의에 초점을 맞췄다.
사용자에게 제품을 탈옥해 보라고 요청하는 일은 중요한 안전 목적을 지닌다. 논문 실험을 넘어 실제 조건에서 시스템을 스트레스 테스트하고, 그 결과를 바탕으로 향후 프로덕션 시스템에 이 방법을 배치하기 전에 강건성을 더 높일 수 있기 때문이다.
데모는 2025년 2월 3일부터 2025년 2월 10일까지 진행됐다. 여기에는 성공적인 탈옥 사례를 신고할 수 있는 피드백 양식과, 참가자들이 따라야 할 Responsible Disclosure Policy 정보가 포함됐다. Anthropic은 성공 사례와 데모의 전반적 결과를 이 글의 업데이트로 발표하겠다고 밝혔다.
2025년 2월 13일 업데이트: 라이브 데모 결과
이 데모의 목표는 Anthropic이 제공한 여덟 개 질문 전부에 걸쳐 시스템으로부터 상세하고 유해한 정보를 끌어낼 수 있는 프롬프팅 전략, 즉 범용 탈옥에 대한 시스템의 강건성을 시험하는 것이었다. 데모가 끝날 무렵, 한 명의 탈옥 시도자가 단 하나의 범용 탈옥으로 시스템이 여덟 개 질문 전부에 상세히 답하게 만드는 데 성공했다.
이번 데모는 AI 보안 커뮤니티의 큰 참여를 이끌어 냈다. 탈옥 시도자 339명3이 300,000회가 넘는 채팅 상호작용을 통해 시스템을 탈옥하려 했고, 이는 총 3,700시간가량의 레드팀 노력에 해당한다.
주요 발견
시스템은 예정된 7일 가운데 5일 동안 탈옥 시도를 견뎌 냈다. 그때까지는 어느 참가자도 도전 과제의 여덟 단계를 모두 통과하지 못했다. 6일째와 7일째에는 네 명의 참가자가 모든 단계를 통과했다. 이 가운데 한 명은 Anthropic이 범용 탈옥으로 판단한 기법을 발견했다. 또 다른 한 명은 마지막 질문을 통과하기 위해 답 일부를 직접 입력해야 했고, 다른 몇몇 질문도 통과하려면 의미 있는 수정이 필요했기 때문에, Anthropic은 이를 범용 탈옥의 경계선에 있는 사례로 보았다. 나머지 두 참가자도 여덟 질문 모두에서 상세한 답을 얻었지만, Anthropic은 이들의 탈옥 기법이 대회 가이드라인에 규정된 범용 탈옥 기준에는 해당하지 않는다고 판단했다.
가장 성공적이었던 탈옥 전략은 다음과 같다.
- 출력 분류기를 우회하기 위해 여러 암호와 인코딩을 사용했다.
- 흔히 시스템 프롬프트를 동반하는 역할극 시나리오를 활용했다.
- 유해한 키워드를 무해한 대체어로 바꿨다. 예를 들어 위험한 화학물질인
Soman을"water"로 바꾸는 식이다. - 프롬프트 인젝션 공격을 구현했다.
그림 3: 도전 과제의 각 단계별 통과 사용자 수를 보여 주는 막대그래프. 1번 질문을 통과한 사용자는 339명이었고, 8번 질문을 통과한 사용자는 4명뿐이었다.
자동 채점기 분석
데모 기간 동안 Anthropic은 시스템 출력이 유해하다고 볼 만큼 충분히 상세한지 식별하기 위해 자동 채점 시스템을 사용했다. 이를 위해 Claude에게, 시스템의 특정 출력과 아무 보호장치가 없는 내부 LLM의 출력 사이에 얼마나 겹치는 내용이 있는지를 검토하게 했다. 그리고 충분한 세부 정보가 공유됐는지 여부를 Claude가 판정하게 했다. 이 자동 채점 시스템은 효과적이었지만 개선이 필요한 부분도 있었다.
- 채점 시스템의 기록을 검토한 결과, 채점기가 전체 질문에 걸친 제출물 가운데 약 1%에 대해 채점을 거부하고 있었다. 4번 질문에서는 거부율이 10%로 더 높았다.
- 검토 결과, 4번 질문에서 채점기가 거부한 사례 가운데 약 1%는 추가적인 출력 비난독화 절차를 거치고 helpful-only 모델을 사용해 다시 채점했다면 통과했을 것으로 나타났다.
- 전체 채점 제출물 가운데 0.26%는 채점기를 다시 돌렸다면 결과가 달라졌을 것으로 나타났다.
대부분의 경우 사용자는 채점기를 다시 실행해 이 문제를 넘었다. Anthropic은 분석 과정에서 이런 오류도 수정했고, 7번 질문은 통과했지만 8번 질문은 통과하지 못한 두 사용자에 대해서는 제출물을 내부적으로 다시 채점했다. 이 채점 시스템은 Anthropic이 시스템의 강건성을 검증하는 데 중요한 역할을 하며, 여기서 얻은 발견은 앞으로 채점 시스템을 더 개선하는 데 도움이 될 것이라고 밝혔다.
실제 위협과의 비교
이 데모는 실제 세계의 위협 시나리오와 두 가지 중요한 차이가 있었다. 이 차이들은 공격자가 데모에서 성공적인 탈옥을 찾기 더 쉽게 만들었지만, 동시에 분류기의 취약점을 더 잘 이해하는 데는 중요했다.
첫째, 자동 채점기는 악의적 행위자가 유해한 질문에서 얻은 정보를 실제로 사용하려 할 때보다 훨씬 촘촘한 피드백 루프를 참가자에게 제공했다. 실제 상황에서 악의적 행위자는 주어진 모델 응답의 품질을 평가하려면 그 응답의 지시를 직접 따라 해 봐야 한다. 이는 Anthropic이 제공한 채점기를 사용하는 것보다 훨씬 어렵고 시간이 많이 드는 일이다.
둘째, 실제 환경에서는 시스템 취약점을 빠르게 식별하고 대응하는 신속 대응 전략을 구현할 수 있다. 예를 들어 반복적으로 분류기를 작동시키는 사용자의 트래픽을 지속적으로 모니터링하고, 그런 사용자를 더 면밀히 조사하며, 취약점이 발견되면 분류기를 업데이트할 수도 있다. 하지만 이 데모에서는 참가자들이 바로 그 분류기 집합에 대한 탈옥을 찾을 수 있도록, Anthropic이 분류기를 전혀 바꾸지 않았다.
상금
Anthropic은 2025년 2월 5일, 여덟 단계를 가장 먼저 통과한 사람에게 10,000달러, 범용 탈옥으로 여덟 단계를 가장 먼저 통과한 사람에게 20,000달러를 지급하겠다고 발표했다. 두 상금은 각각 다른 탈옥 시도자가 받게 됐다. 또한 시스템을 탈옥하는 데 필요한 노력을 인정해, 원래 상금 기준에는 들지 않았지만 여덟 단계를 모두 통과한 나머지 두 사용자에게도 추가 상금을 지급하기로 했다. 그 결과 Anthropic은 이 데모의 여덟 단계를 모두 돌파한 네 명의 사용자에게 총 55,000달러를 지급하게 됐다.
수상자
Anthropic은 시스템 탈옥에 기여한 다음 탈옥 시도자들에게 감사를 표했다.
- Altynbek Ismailov and Salia Asanova: Anthropic이 범용 탈옥으로 판단한 기법으로 도전 과제의 여덟 단계를 처음으로 모두 통과한 참가자 팀.
- Valen Tagliabue: 도전 과제의 여덟 단계를 처음으로 모두 통과한 참가자.
- Hunter Senft-Grupp: Anthropic이 경계선상의 범용 탈옥으로 본 기법으로 여덟 단계를 모두 통과한 참가자.
- Andres Aldana: 도전 과제의 여덟 단계를 모두 통과한 참가자.
향후 전망
Anthropic은 이번 결과가 분류기 개선을 위한 귀중한 통찰을 제공한다고 본다. 성공적인 탈옥 전략이 실제로 시연되면서, 잠재적 취약점과 더 높은 강건성이 필요한 지점을 이해할 수 있게 됐다는 것이다. Anthropic은 결과를 계속 분석해 향후 시스템 개선에 반영하고, 수용 가능한 수준의 탈옥 강건성을 유지하면서도 과잉 거절과 연산 오버헤드를 더 줄이는 작업을 이어 갈 계획이라고 밝혔다.
탈옥 강건성은 모델의 역량이 더 커질수록 화학, 생물, 방사능, 핵 위험으로부터 보호하기 위해 필요한 핵심 안전 요건이다. 이번 데모는 이런 분류기가 특히 다른 기법과 결합될 때 그러한 위험을 완화하는 데 도움이 될 수 있음을 보여 줬다고 Anthropic은 평가한다.
Anthropic은 이번 시연에 시간과 전문성을 들여 준 모든 참가자에게 감사의 뜻을 전했다. 그들의 노력이 AI 안전성 향상을 위한 매우 값진 데이터를 제공했다는 것이다.
변경 로그
2025년 2월 5일 업데이트: 시스템의 성공적인 탈옥에 대해 금전 보상을 제공하기 시작했다. 탈옥 데모의 여덟 단계를 가장 먼저 모두 통과한 사람은 10,000달러를, 범용 탈옥 전략으로 여덟 단계를 가장 먼저 모두 통과한 사람은 20,000달러를 받는다. 보상과 관련 조건의 전체 세부 사항은 HackerOne에서 확인할 수 있다.
2025년 2월 10일 업데이트: 라이브 탈옥 데모가 종료됐다. 모델을 탈옥하려고 시도한 수많은 참가자에게 깊이 감사하며, 도전 과제의 수상자들에게 축하를 전한다. Anthropic은 현재 결과 확인과 보상 지급을 진행하고 있으며, 이번 데모에서 무엇을 배웠는지에 대한 전체 업데이트를 추후 제공할 예정이다.
2025년 2월 13일 업데이트: "라이브 데모 결과" 섹션을 추가했다.
2025년 2월 18일 업데이트: 수상한 탈옥 시도자들의 이름을 추가했다.
감사의 말
Anthropic은 프로토타입 시스템 레드팀을 위한 버그 바운티 프로그램을 지원한 HackerOne에 감사를 표했다. 또한 다른 프로토타입 버전에 대한 레드팀 작업을 수행한 Haize Labs, Gray Swan, UK AI Safety Institute에도 감사를 전했다.
팀 합류 안내
탈옥 강건성이나 모델 보호장치와 관련된 다른 문제를 다루는 일에 관심이 있다면, Anthropic은 현재 Research Engineers / Scientists를 채용 중이라고 밝혔다.
각주
- 이 역량 임계치는 기본적인 기술 배경, 예를 들어 학부 수준 STEM 학위를 가진 개인이나 집단이 CBRN 무기를 생성·획득·배치하는 데 시스템이 유의미하게 도움을 줄 수 있는 경우를 뜻한다. 따라서 비AI 기준선, 예를 들어 검색 엔진이나 교과서와 비교할 때, 재난적 오용 위험이 실질적으로 더 높아질 수 있다.
- Anthropic은 참가자가 시스템에 최소 15개의 질의를 했고, 분류기에 의해 최소 3회 차단됐을 때 그 참가자를 "활성" 참가자로 간주했다.
- 이 수치는 적어도 하나의 질문을 통과한 참가자만 걸러 집계한 것이다. 이는 탈옥 경험이 있는 레드팀원을 상대로 시스템이 얼마나 잘 작동했는지 더 잘 이해하기 위한 조치였다. 전체 사용자 기준으로 보면 이 데모는 13,960명이 시도했고, 800,000회가 넘는 채팅을 만들었으며, 총 10,000시간 이상을 테스트에 사용했다.
