Anthropic 헌법 분류기: 보편적 제거 공격에 대한 방어
요약
Anthropic는 헌법 분류기(Constitutional Classifiers)를 도입하여, 클로드 3.5 손넷에서 보편적 제거 공격의 95% 이상을 차단했으며, 과도한 거부율은 0.38% 증가, 계산 비용은 약 24% 증가에 그쳤다.
헌법 분류기란 무엇인가?
헌법 분류기는 입력과 출력에 대해 각각 별도의 신경망 분류기로, 허용되거나 금지된 콘텐츠 카테고리(예: 마늘 소스는 허용되지만, 마늘 가스 조리법은 금지됨)를 나열하는 헌법(constitution)에서 생성된 대규모 합성 데이터셋을 기반으로 훈련된 시스템이다. 이 분류기는 언어 모델이 콘텐츠를 생성하거나 반환하기 전에 헌법을 위반하는 프롬프트나 응답을 탐지하고 차단한다.
"두 기술 모두 헌법을 사용한다: 모델이 따라야 할 원칙 목록이다. 헌법 분류기의 경우, 원칙은 허용되거나 금지되는 콘텐츠 유형을 정의한다."
훈련 파이프라인
- 헌법 생성 – 인간이 작성한 무해한 vs. 해로운 콘텐츠 카테고리 목록으로, 초기에는 화학, 생물학, 방사선 및 핵(CBRN) 위협에 집중한다.
- 합성 데이터 생성 – 클로드가 각 카테고리에 대해 수백만 개의 프롬프트-완성 쌍을 생성한 후, 언어 번역, 스타일 변형(이미 알려진 제거 공격 스타일 포함), 인코딩 기법 등을 통해 데이터를 증강한다.
- 균형 잡힌 데이터셋 – 계약자로부터 제공된 고정된 무해한 질의 세트를 추가하여 과도한 거부율을 낮춘다.
- 분류기 훈련 – 입력 및 출력 분류기를 훈련하여 프롬프트나 응답이 금지된 클래스에 속하는지 예측하도록 한다.
- 배포 – 추론 시점에서 분류기가 모델을 통제한다: 거부된 프롬프트는 클로드에 도달하지 않으며, 거부된 완성은 사용자에게 전송되기 전에 제거된다.
인간 레드팀 평가 (프로토타입)
- 환경 설정: 독립적인 제거 공격자들이 버그 바운티 프로그램에 참여하여, 2024년 6월 기준 클로드 3.5 손넷(프로토타입 분류기 보호)이 10개의 사전 선택된 "금지된" 질의에 답변하도록 유도하려 했다.
- 노력: 183명의 참가자가 2개월 동안 3,000시간 이상을 투자했으며, 보편적 제거 공격에 성공 시 15,000달러의 보상이 주어졌다.
- 결과: 단일 제거 공격으로 10개의 질의에 모두 상세한 답변을 얻은 참가자는 없었으며, 따라서 보편적 제거 공격은 발견되지 않았다.
- 한계: 프로토타입은 무해한 질의에서 과도한 거부율이 높았고, 계산 비용이 상당히 증가하여 두 번째 개선 버전이 필요했다.
자동화된 합성 평가 (업데이트된 시스템)
- 데이터셋: 가장 효과적인 알려진 공격과 새로운 분류기 회피 기법을 포함한 10,000개의 합성 제거 공격 프롬프트.
- 기준선: 분류기가 없을 경우, 클로드 3.5 손넷(2024년 10월)은 이 프롬프트의 86%를 허용했다.
- 헌법 분류기 적용 시: 성공률은 **4.4%**로 떨어졌으며, 이는 제거 공격 시도의 95% 이상이 차단되었음을 의미한다.
- 과도한 거부 영향: 무해한 질의에 대한 거부율은 0.38% 증가했으며, 5,000건의 대화 샘플에서 통계적으로 유의미하지 않은 변화였다.
- 계산 오버헤드: 추론 비용은 23.7% 증가했으며, 중간 수준으로 평가되었다.

라이브 데모 (2025년 2월 3일~10일) 및 실제 레드팀 결과
- 참여자: 339명의 제거 공격자가 30만 개 이상의 채팅 상호작용(~3,700시간)을 생성했다.
- 성공 사례: 네 명의 참가자가 여덟 단계의 모든 도전 과제를 완료했으며, 한 명은 보편적 제거 공격을 달성했고, 다른 한 명은 경계선 보편적 제거 공격을 달성했다.
- 공통 전략:
- 출력 분류기 회피를 위한 암호화 및 인코딩 기법
- 역할극 시스템 프롬프트
- 키워드 대체 (예: "소만" → "물")
- 프롬프트 삽입 공격
- 자동 평가기 성능: 전체적으로 약 1%의 제출물에 대해 평가를 거부했으며, 질문 4에서는 10%에 해당했다. 탈가시화 후 재평가 시 약 0.26%의 사례에서 결과가 달라졌을 것이다.
- 보상: 성공한 네 명의 참가자에게 총 55,000달러를 지급 (모든 레벨 완료: 10,000달러, 보편적 제거 공격: 20,000달러, 추가 상금 포함).

한계 및 향후 연구 방향
- 완전한 커버리지 부족: 헌법 분류기는 보편적 제거 공격을 완전히 보장하지 않으며, 남아 있는 공격은 더 많은 노력을 필요로 한다.
- 진화하는 위협: 새로운 제거 기법이 등장할 수 있으며, 외부 모니터링, 동적 응답 전략과 같은 보완 방어가 필요하다.
- 적응성: 기반 헌법은 새로운 공격 패턴을 신속히 반영할 수 있도록 업데이트할 수 있다.
- 지속적인 목표: 과도한 거부율을 더 낮추고, 계산 오버헤드를 줄이며, 생산 배포 전에 추가 안전 레이어와 통합하는 것이다.
Anthropic의 안전 로드맵에서의 위치
Anthropic의 책임 있는 확장 정책(Responsible Scaling Policy) 하에, CBRN 관련 피해 위험이 수용 가능한 수준으로 완화되면 모델이 배포될 수 있다. 헌법 분류기는 CBRN 능력 한계를 초과한 모델에 대해 필요한 완화를 제공함으로써, 점점 더 강력한 LLM의 안전한 확장을 가능하게 한다.
데모 접근 방법
헌법 분류기로 보호된 클로드 3.5 손넷의 라이브 데모는 다음 URL에서 제공되었으나, 현재 아카이브됨: https://claude.ai/redirect/website.v1.082e291e-714e-4b74-8d3d-6bb3e9114f91/constitutional-classifiers
참고자료
- 논문: 헌법 분류기: 보편적 제거 공격에 대한 방어 (arXiv 2501.18837) – https://arxiv.org/abs/2501.18837
- 관련 연구: 헌법 기반 AI (arXiv 2212.08073) – https://arxiv.org/abs/2212.08073
- 버그 바운티 프로그램: https://www.anthropic.com/news/model-safety-bug-bounty
- 책임 있는 확장 정책: https://www.anthropic.com/news/announcing-our-updated-responsible-scaling-policy
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch