Anthropic Improves Claude Fable 5 Biology Safeguards

Anthropic은 Claude Fable 5의 생물학적 안전장치를 업데이트하여, 제품 전반에 걸쳐 생물학 관련 "fallback"—시스템이 쿼리를 성능이 낮은 모델로 재라우팅하는 것—을 약 85% 감소시켰습니다. 이번 업데이트를 통해 Fable 5는 고위험 이중 용도(dual-use) 기능을 계속 제한하면서도, 교육적 질의 및 일상적인 건강 질문을 포함한 더 넓은 범위의 무해한 생물학적 작업을 지원할 수 있게 되었습니다.

Expanded Access to Benign Biology Tasks

Fable 5는 이제 현저히 적은 오탐(false positives)으로 더 다양한 생물학 관련 요청을 처리할 수 있습니다. 사용자는 다음과 같은 작업을 수행할 때 중단 현상을 덜 경험하게 될 것입니다:

  • Everyday Health and Education: 실험실 결과 해석, 증상 이해, 교육적 맥락에서의 생물학 학습.
  • Clinical Support: 의료 전문가들은 이제 임상 작업을 위해 Fable 5로부터 더 많은 지원을 받을 수 있습니다.

이러한 개선 사항에도 불구하고, Fable 5는 바이러스학, 독성학 및 분자 설계를 포함하는 요청을 Opus 5로 계속 라우팅합니다. 이러한 분야는 이중 용도로 분류되며, 전문적인 생물학 연구나 신약 개발을 위해 아직 사용할 수 없습니다.

The Risk of Dual-Use Biological Capabilities

Anthropic은 Fable 5의 생물학적 능력이 특정 복잡한 작업에서 전문가를 능가할 수 있어, 악의적인 행위자에게 "uplift" 위험을 제공할 수 있기 때문에 엄격한 안전장치를 유지합니다. 주요 과제는 생물학적 연구의 "이중 용도" 특성입니다. 즉, 유익한 목적으로 사용되는 동일한 기술이 해로운 목적으로 전용될 수 있다는 점입니다.

  • Ambiguity of Intent: 치료법 연구는 종종 위험한 화합물을 생성해야 합니다. 예를 들어, 생백신을 만들기 위해서는 백신이 예방하고자 하는 것과 동일한 병원균을 배양해야 하며, 고혈압 치료제인 captopril 개발에는 뱀 독의 독성 성분을 분리하는 과정이 필요했습니다.
  • External Threats: Anthropic은 미국 정보 공동체의 2026년 연례 위협 평가를 인용하며, 합성 생물학 및 유전체 편집의 발전이 새로운 생물학적 위협을 초래할 수 있다고 언급했습니다. 특히 공격적인 생물학 및 화학 무기 프로그램을 보유한 국가 행위자로부터의 위협을 지적했습니다.

재앙적인 오용의 가능성 때문에, Fable 5는 안전장치가 정교화되는 동안 다른 도메인에서의 일반적인 가용성을 보장하기 위해 초기 출시 당시 거의 모든 생물학적 질의를 차단하도록 설정되었습니다.

Technical Implementation of Biology Safeguards

Anthropic은 Fable 5가 보호 대상 작업 수행을 요청받거나 유해한 출력을 생성하는지 감지하기 위해 안전 분류기(safety classifiers)—더 작은, 자동화된 AI 시스템—를 활용합니다.

The Fallback Mechanism

안전 분류기가 트리거되면 시스템은 단순히 요청을 차단하는 것이 아니라, 사용자의 쿼리를 Opus 5로 재라우팅합니다. Opus 5는 유능한 모델이지만 Fable 5의 고수준 생물학적 능력을 갖추고 있지 않으므로, 악의적인 사용자가 받을 수 있는 지원을 제한할 수 있습니다.

Refining the Classifier

유해한 콘텐츠를 놓치는 오탐지(false negatives)를 늘리지 않으면서 오탐(false positives)을 줄이기 위해, Anthropic은 다음과 같은 업데이트를 구현했습니다:

  1. Constitutional Rewrite: 팀은 보호 대상 콘텐츠와 허용된 콘텐츠를 구별하는 데 사용되는 규칙 세트인 분류기의 "constitution"을 다시 작성하여 무해한 용도를 더 상세하게 정의했습니다.
  2. Expert Consultation: Anthropic은 이러한 변경 사항에 대해 내부 및 외부 전문가 그룹으로부터 피드백을 받았습니다.
  3. Retraining: 분류기는 새로운 constitution에 기반한 업데이트된 학습 데이터를 사용하여 재학습되었으며, 새로운 constitution에 의해 무해한 콘텐츠는 허용하면서도 유해하거나 이중 용도 연구에 대해서는 여전히 트리거되도록 검증되었습니다.

Anthropic은 과도한 주의로 인해 저위험 요청이 여전히 차단되는 "안전 마진" 내의 일부 오탐이 남아 있을 것임을 인정합니다. 회사는 전문 연구원들이 최첨단 최첨단 생물학적 능력을 안전하게 사용할 수 있는 신통한 접근 경로를 개발하는 데 전념하고 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch