Anthropic, Claude Fable 5 및 Mythos 5에 대한 접근 복원

요약

Anthropic는 미국 수출 통제가 해제된 후 전 세계적으로 Claude Fable 5 및 Claude Mythos 5에 대한 접근을 복원했으며, 더 강화된 안전 분류기, 산업 전반의 잠금 해제 심각도 프레임워크 제안, 미국 정부와의 심화된 협력을 도입했습니다.


즉시 사용 가능 및 이용 조건

  • Claude Fable 5는 7월 1일부터 Claude Platform, Claude.ai, Claude Code, Claude Cowork에서 이용 가능합니다. Pro, Max, Team 및 일부 Enterprise 계획 사용자는 7월 7일까지 주간 사용 한도의 최대 **50%**까지 모델을 사용할 수 있으며, 이후에는 사용 크레딧을 통해 접근합니다.
  • Claude Mythos 5는 6월 26일 미국 정부의 승인을 받은 일부 미국 기관에 대해 복원되었습니다. AWS, Google Cloud, Microsoft Foundry와 같은 주요 클라우드 제공업체에서의 접근은 가능한 한 빨리 재개될 예정입니다.
  • 두 모델은 동일한 기반 아키텍처를 공유합니다. Fable 5는 가장 강력한 보호 조치와 함께 출시되었으며, Mythos 5는 초기에 방어적 사이버보안 작업을 위한 신뢰할 수 있는 Project Glasswing 파트너에게만 제한적으로 제공되었습니다.

사건 일정 및 안전 보호 강화

날짜 사건
6월 9일 Claude Fable 5 및 Claude Mythos 5 출시
6월 12일 아마존이 보고한 우회 기법으로 인해 Fable 5가 소프트웨어 취약점을 열거하고, 한 경우에서는 공격 코드를 생성할 수 있었음. 이에 따라 미국 정부가 수출 통제를 시행
6월 12일 ~ 30일 Anthropic는 정부 및 파트너와 협력하여 보고서를 검토하고, 다른 모델을 테스트하며 새로운 안전 분류기를 개발
6월 30일 수출 통제 해제 (출처: Howard Lutnick, X)
7월 1일 Fable 5의 전 세계 재배포; 제한된 미국 지역에서 Mythos 5 재배포

주요 안전 보호 업데이트: 새로운 안전 분류기는 아마존 보고서에 기술된 특정 기법을 99% 이상의 시도에서 차단합니다. 요청이 차단될 경우 사용자에게 알리고 쿼리는 Opus 4.8로 재루팅됩니다. 이 분류기는 안전한 코딩/디버깅 작업에 대해 일부 오진을 유발할 수 있으나, Anthropic는 안전 마진을 유지하기 위해 이 상황을 수용합니다.


Anthropic의 사이버보안 안전 보호 전략

  • 다층 방어(Defense-in-depth): 모델 수준의 거부 학습, 사후 오용 분석, 전용 분류기 등 여러 계층이 함께 작동하여 위험한 행동을 방지합니다.
  • 안전 분류기: 해로운 사이버보안 작업을 포함할 가능성이 높은 요청을 식별하는 소규모 AI 시스템입니다. Fable 5의 경우 안전 마진을 의도적으로 넓혀, 진정으로 위험한 요청이 거의 놓치지 않도록 합니다. 이로 인해 일부 무해한 요청도 차단될 수 있습니다.
  • 분류기 동작 다이어그램(개요):
    • 행 A – 기본 분류기 동작
    • 행 B – Fable 5의 확장된 안전 마진, 더 많은 무해한 요청을 차단하지만 위험한 사례를 놓치는 것을 줄입니다.
    • 행 C~E – 미세한, 좁은, 보편적인 잠금 해제가 마진과 어떻게 상호작용하는지를 보여줍니다.
  • 잠금 해제 저항성: 미세한 잠금 해제는 분류기를 우회할 수 있지만 여전히 안전 마진 내에 머무르며 피해를 제한합니다. 좁은 위험한 잠금 해제는 드물며, 현재까지 Fable 5에 대해 보편적인 잠금 해제는 관찰되지 않았습니다.
  • 지속적인 개선: Anthropic는 오진을 줄이되, 공격적 사이버 능력에 대한 강력한 보호를 유지하기 위해 분류기를 계속 조정할 예정입니다.

산업 전반의 AI 잠금 해제 심각도 프레임워크 제안

Anthropic는 아마존, 마이크로소프트, 구글 및 기타 Glasswing 파트너들과 함께, 잠금 해제를 네 가지 차원에서 평가하는 합의된 기준을 마련하고 있습니다:

  1. 능력 향상 – 기존 도구를 초월해 얼마나 많은 발전을 이뤘는가
  2. 능력 향상의 포괄성 – 잠금 해제가 가능하게 하는 독립적인 공격 작업의 수
  3. 무기화 용이성 – 잠금 해제를 공격으로 전환하기 위해 필요한 인간의 노력
  4. 발견 가능성 – 기술이 얼마나 쉽게 발견되고 재사용 가능한가

이 프레임워크는 정부와의 소통을 표준화하고, 대응 우선순위를 설정하기 위한 것입니다.

  • 응답 계층화: 가장 심각한 범주(예: 핵심 인프라를 위협할 수 있는 잠금 해제)는 즉시 대응 조치를 시행하고 24/7 모니터링을 시작합니다.
  • 커뮤니티 참여: Anthropic는 Fable 5에서 사이버 잠금 해제 발견을 제출할 수 있는 HackerOne 프로그램을 시작했습니다.

미국 정부와의 심화된 협력

Anthropic는 연방 기관과의 파트너십을 확대하기 위해 네 가지 구체적인 약속을 제시합니다:

  1. 사전 출시 접근 – 지정된 정부 파트너는 독립적인 평가를 위해 조기 모델 및 보호 조치에 접근할 수 있습니다.
  2. 빠른 보호 조치 공유 – 중요한 잠금 해제나 오용 패턴은 신속히 보고되며, 새로운 완화 조치는 독립적인 테스트를 위해 공유됩니다.
  3. 전용 공동 연구 자원 – Anthropic는 정부 주도의 AI 보안 연구를 지원하기 위해 컴퓨팅 자원과 인력을 배정할 예정입니다.
  4. 산업 공동 보안 기준 – 정부 및 동료들과 협력하여 자발적이고 산업 전반의 보안 및 평가 기준을 개발합니다.

이 조치들은 6월 2일 발표된 고급 인공지능 혁신 및 보안 촉진에 관한 행정명령과 부합하며, 강력한 전면 모델을 출시하는 데 있어 투명하고 지속 가능한 과정을 만들려는 목표를 가지고 있습니다.


사용자 및 AI 생태계에 대한 영향

  • 개발자에게: Fable 5의 고급 기능에 대한 접근이 복원되었지만, 일반적인 코딩 작업 중에 때때로 요청이 차단될 수 있음을 예상해야 합니다.
  • 보안 연구자에게: 새로운 HackerOne 프로그램을 통해 잠금 해제를 보고할 수 있는 명확한 경로가 제공되며, 빠른 대응이 약속됩니다.
  • 정책 입안자에게: Anthropic의 프레임워크와 정부 파트너십은 산업이 자율 규제하면서도 규제 기관과 협력할 수 있는 구체적인 사례를 제공합니다.
  • 전체 AI 커뮤니티에게: 공통된 잠금 해제 심각도 분류 체계를 추진하는 움직임은 새로운 모델 우회 기법이 발견되었을 때 불확실성을 줄이기 위해 사실상 표준이 될 가능성이 있습니다.

관련 발표

  • Fable 5의 생물학적 보호 강화 – Anthropic의 후속 게시물 참조
  • Mariano-Florentino (Tino) Cuéllar, Anthropic의 수석 글로벌 사업 책임자로 임명 – 회사의 정책 및 파트너십 역량 확대

Sources

관련