Anthropic Constitutional Classifiers++ 출시

Anthropic은 대규모 언어 모델을 탈옥(jailbreak)으로부터 보호하기 위해 설계된 차세대 안전 시스템인 Constitutional Classifiers++를 개발했습니다. 탈옥은 안전 가드레일을 우회하여 유해한 정보, 특히 화학, 생물학, 방사능 또는 핵(CBRN) 무기에 관한 정보를 이끌어내기 위해 사용되는 기술입니다. 이 새로운 시스템은 안전 모니터링의 컴퓨팅 비용을 약 1%로 크게 줄이는 동시에 테스트 과정에서 범용 탈옥(universal jailbreaks)의 발견을 제거했습니다.

1세대 Constitutional Classifiers로부터의 진화

기존의 Constitutional Classifiers는 자연어 규칙으로 구성된 "constitution"에서 파생된 합성 데이터로 학습된 안전 장치였습니다. 이들은 탈옥 성공률을 86%에서 4.4%로 낮추었지만(공격의 95%를 차단), 다음과 같은 상당한 운영상의 트레이드오프를 초래했습니다:

  • Compute Costs: 컴퓨팅 비용이 23.7% 증가했습니다.
  • False Refusals: 무해한 질의에 대한 거부율이 0.38% 증가했습니다.
  • Vulnerability: 버그 바운티 프로그램 중에 하나의 범용 탈옥이 발견되었습니다.

The Constitutional Classifiers++ Architecture

Constitutional Classifiers++는 견고함과 효율성의 균형을 맞추기 위해 앙상블 방어 및 "cascade architecture"를 활용합니다. 시스템은 두 단계로 작동합니다:

Stage 1: Internal Probe Classifiers

첫 번째 단계는 선형 프로브(linear probes)를 사용하여 Claude의 내부 활성화(internal activations)를 모니터링합니다. 이러한 프로브는 응답이 생성되기 전에 모델의 신경망에서 유해한 콘텐츠를 암시하는 패턴을 식별합니다. 이러한 프로브는 기존 계산을 재사용하기 때문에 컴퓨팅 비용이 저렴하며, 공격자가 최종 출력보다 조작하기 더 어렵습니다.

Stage 2: Exchange Classifiers

내부 프로브가 대화를 의심스러운 것으로 표시하면, 더 강력한 두 번째 단계의 분류기(classifier)로 에스컬레이션됩니다. 입력과 출력을 별도로 검사하던 이전 버전과 달리, 이 "exchange classifier"는 입력의 맥락에서 출력을 모니터링합니다. 이를 통해 공격자가 암호(예: 화학 시약에 대한 "food flavorings")를 사용하는 경우와 같이, 입력과 출력을 함께 보았을 때만 명확해지는 유해한 의도를 탐지할 수 있습니다.

Performance and Benchmarks

Claude Sonnet 4.5 트래픽에 적용하여 배포했을 때, Constitutional Classifiers++ 시스템은 다음과 같은 결과를 보여주었습니다:

  • Refusal Rate: 무해한 질의에 대한 거부율이 0.05%로 떨어졌으며, 이는 기존 시스템과 비교하여 87% 감소한 수치입니다.
  • Compute Overhead: Claude Opus 4.0 트래픽에 적용했을 때, 시스템은 약 1%의 컴퓨팅 오버헤드를 추가합니다.
  • Robustness: 198,000건의 레드팀(red-teaming) 시도(누적 1,700시간 이상)를 통해 단 하나의 고위험 취약점이 발견되었으며, 이는 1,000건의 질의당 0.005건의 탐지율을 나타냅니다. 범용 탈옥은 발견되지 않았습니다.

Identified Vulnerabilities and Model Degradation

이러한 개선 사항에도 불구하고, Anthropic은 여전히 도전적인 두 가지 공격 범주를 식별했습니다:

  1. Reconstruction Attacks: 유해한 정보를 무해해 보이는 세그먼트로 분해하여 나중에 재조립하는 방식입니다(예: 코드베이스 전체에 걸쳐 함수로 질의를 임베딩하는 방식).
  2. Output Obfuscation Attacks: 은유, 수수께끼 또는 무해한 대체어를 사용하여 출력을 위장하도록 모델에 유도하는 방식입니다.

Anthropic은 이러한 탈옥 시도가 모델의 실제 성능을 저점을 낮추는 경우가 많다고 언급했습니다. GPQA Diamond 벤치마크(PhD 수준의 과학 개념)에서 특정 탈옥 기술이 적용되었을 때 모델 성능이 74%에서 32%까지 떨어졌습니다.

Future Research Directions

Anthropic은 시스템을 더욱 강화하기 위해 다음과 같은 여러 경로를를 탐색하고 있습니다:

  • 분류기 신호(classifier signals)를 응답 생성 과정에 직접 통합하는 방식.
  • 모델이 은폐(obfuscation)에 더 잘 저항하도록 학습시키는 방식.
  • 분류기를 위한 고품질의 학습 데이터를 생성하기 위해 자동화된 레드팀(automated red-teaming)을 활용하는 방식.

Sources

관련