Claude Fable 5.1 및 Claude Mythos 5.1 릴리스 노트

Anthropic는 고성능 코딩, 지식 작업 및 과학 연구를 위한 모델인 Claude Fable 5.1과 Claude Mythos 5.1을 출시했습니다. 두 모델은 동일한 기반 아키텍처를 공유하지만, 보안 설정에서 차이가 있습니다: Fable 5.1은 일반 공개 버전이며, Mythos 5.1은 사이버보안 및 생명과학 전문가를 위한 신뢰된 접근 프로그램에 한정됩니다.

비용 절감 및 API 가격

Claude Fable 5.1은 캐시 읽기 비용을 75% 감축하여 100만 토큰당 $0.25로 낮췄습니다. 이 변경은 모델이 자주 처리된 컨텍스트를 재읽는 장시간 실행 에이전트 워크플로우를 대상으로 합니다.

  • 일반 워크로드: Fable 5 대비 약 25%의 전체 비용 절감이 예상됩니다.
  • 에이전트 워크로드: 높은 캐시 읽기 빈도로 인해 최대 45%의 절감이 가능합니다.
  • 기본 가격: 입력 토큰은 100만 토큰당 $10, 출력 토큰은 100만 토큰당 $50입니다.

과학 연구 및 계산 능력

Claude Mythos 5.1은 분자 설계 및 계산 생물학 분야에서 고도의 능력을 보여주며, 종종 인간 전문가나 기존 오픈소스 도구를 능가합니다.

분자 설계 및 생물학

단백질 설계에서 Mythos 5.1은 12개의 타겟에 대해 고친화 결합체를 설계할 때 거의 50%의 성공률을 기록했으며, 현재 단백질 설계 관행의 일반적인 10-15% 성공률보다 훨씬 높습니다. 또한, 모델은 맞춤형 GPU 커널을 작성하여 7개의 오픈소스 딥러닝 모델을 최적화해 추론 속도를 최대 2.5배 향상시키고 GPU 비용을 30-60% 감소시켰습니다.

행성 과학

Claude Fable 5.1은 30년 전 NASA Magellan 레이더 이미지를 활용해 화성의 1/3에 대한 고해상도 고도 지도를 생성했습니다. 결과 지도는 이전의 10-20km에서 2-3km까지 세부 정보를 제공하며, 고도 정확도를 최대 25% 향상시켰습니다.

성능 벤치마크

Fable 5.1은 에이전트 과학 연구 및 코딩 분야에서 Fable 5 및 기타 최전방 모델보다 뚜렷한 향상을 보였습니다.

벤치마크 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Agentic Coding (Terminal-Bench 4.0) 55.8% 42.0% 52.3% 37.3%
Knowledge Work (GDPval-AA v2) 1853 1723 1824 1711
OSWorld 2.0 (Partial) 77.9% 72.9% 75.4%
Humanity's Last Exam (No Tools) 60.9% 57.8% 56.6%
AutomationBench 31.4% 17.1% 26.9% 19.6%

참고: Mythos 5.1은 Terminal-Bench 4.0에서 60.9%를 기록했습니다.

프라이버시 및 기업용 보호 기능

Anthropic는 데이터 보존 정책이 0인 기업용 최전방 보호 기능(EFS)을 도입합니다. 이 시스템은 악성 사용을 탐지할 수 있는 능력을 유지하면서도, 데이터를 Anthropic가 아닌 고객이 완전히 통제하는 클라우드 인프라에 저장합니다.

  • 가용성: 2026년 가을부터 AWS, Google Cloud, Microsoft Azure에서 단계적으로 제공될 예정입니다.
  • 임시 솔루션: EFS가 완전히 배포될 때까지 자격이 있는 고객은 Fable 5.1을 사용해 데이터를 보존하지 않고 이용할 수 있습니다.

보안 및 일치성

사이버보안 및 생물학 보호 기능

Fable 5.1은 사이버보안 작업에서 오진률을 60% 감소시켰으며, 방어적 목적의 소프트웨어 취약점 식별을 허용합니다. 그러나 이중 용도 작업(예: 악성코드 생성 및 침투 테스트)은 여전히 Opus 모델로 리디렉션됩니다. 생물학 분야에서는 Fable 5보다 유해하지 않은 요청(의학/기초 생물학)에 대한 보호 기능이 85% 적게 작동합니다.

반분산화 및 워터마킹

모델 능력의 불법 추출을 방지하기 위해 Fable 5.1은 강화된 반분산화 메커니즘을 구현했습니다. 새로운 API 계정은 다중 대화에서 이전 컨텍스트를 수동으로 편집하면서 모델의 사고 기록을 유지할 수 없습니다.

또한, EU AI Act 준수를 위해 Anthropic는 텍스트 출력에 보이지 않는 워터마킹을 도입했습니다. 감지 API는 현재 규제 기관, 수사 기관 및 자격이 있는 조직을 대상으로 비공개 프리뷰 중입니다.

커뮤니티 인사이트 및 반론

Hacker News 사용자와 개발자들은 질적 피드백과 기술적 비판을 혼합하여 의견을 제시했습니다:

  • 작문 스타일: 일부 사용자는 더 자연스러운 문체와 더 적은 표준 표현을 언급했지만, 다른 사용자는 출력이 더 농축되고 요약성이 떨어졌다고 주장했습니다.
  • 최전방 발전의 종말: 일부 비평가들은 과학 외 벤치마크에서의 미미한 성과 향상이 최전방 모델 발전의 정체를 시사한다고 의문을 제기했습니다.
  • 비용 대 가치: 캐시 할인에도 불구하고, 일부 개발자는 DeepSeek 또는 GLM과 같은 저렴한 대안에 비해 일반 코딩 에이전트에 대한 비용이 여전히 지나치게 높다고 주장했습니다.
  • 기술적 특이점: 사용자들은 Fable 5.1이 작은 변경에 대해 전체 파일을 다시 작성하는 경향이 있으며, 이로 인해 토큰 소비가 증가한다고 보고했습니다. Anthropic는 특정 시스템 프롬프트 지시를 추가하여 정밀한 수정을 장려할 것을 권장합니다.

"내부 벤치마크에서 Claude Fable 5.1은 Fable 5나 Opus 5보다 더 많은 코딩 문제를 해결하며, 거래 직관 분야에서 최첨단 성과를 달성했습니다." — Craig Falls, Jane Street Capital 양자 연구 책임자

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch