Claude Fable 5 및 Mythos 5 출시

Anthropic은 Claude Fable 5Claude Mythos 5를 출시했으며, 이는 특히 소프트웨어 엔지니어링, 과학 연구 및 복잡한 분석 작업에서 AI 역량의 큰 도약을 의미합니다. Fable 5는 일반에 제공되는 반면, Mythos 5는 사이버 방어자와 생명 과학 연구자를 위한 신뢰된 접근 프로그램에 제한됩니다.

고수준 기능 및 성능

Claude Fable 5는 이전에 광범위한 인간 조정이 필요했던 장기 자율 작업을 위해 설계되었습니다. 거의 모든 테스트 벤치마크에서 최첨단 성능을 보여주며, 작업 복잡도가 증가함에 따라 이전 모델 대비 우위가 커집니다.

소프트웨어 엔지니어링 및 코딩

Fable 5는 에이전트 기반 코딩 및 자율성에서 눈에 띄는 향상을 보입니다.

  • Codebase Migrations: 초기 테스트에서 Stripe는 Fable 5가 5천만 라인 규모의 Ruby 코드베이스 전체 마이그레이션을 하루 만에 완료했다고 보고했습니다. 이는 인간 팀이 두 달 이상 걸릴 작업입니다.
  • Production Standards: Cognition의 FrontierCode 평가에서 Fable 5는 최전선 모델 중 가장 높은 점수를 받아 고품질 프로덕션 코드 표준을 충족하는 뛰어난 능력을 보여주었습니다.
  • Efficiency: 초기 사용자 피드백에 따르면 모델이 토큰 효율성이 높아, 결과를 더 적은 턴으로 제공하고 보다 정교하고 유지보수가 쉬운 diff를 생성합니다.

과학 연구 및 약물 설계

Claude Mythos 5를 통해 Anthropic은 자율 과학 발견에서 획기적인 성과를 달성했습니다:

  • Protein Design: 내부 전문가들은 약물 설계 과정이 10배 가속화되었다고 보고했습니다. Mythos 5는 결합 부위 선택 및 단백질 설계 도구 실행에서 숙련된 인간 운영자를 능가하거나 동등한 성과를 보였습니다.
  • Molecular Biology: 모델은 지속적으로 새로운 과학적 가설을 생성하며, 과학자들은 약 80%의 경우 Opus-클래스 모델보다 Mythos의 가설을 선호합니다.
  • Genomics: Mythos 5는 일주일 동안 자율 유전체 연구를 수행했으며, 맞춤형 머신러닝 모델을 훈련시켜 Science에 발표된 최근 연구보다 100배 작은 규모임에도 불구하고 성능을 능가했습니다.

비전 및 분석적 추론

Fable 5는 비전 및 복잡한 추론 분야에서 새로운 최첨단 기능을 도입했습니다:

  • Vision Tasks: 모델은 스크린샷만으로 웹 앱의 소스 코드를 재구성하고 과학 도표에서 정확한 숫자를 추출할 수 있습니다.
  • Knowledge Work: Hebbia의 Finance Benchmark에서 Fable 5는 문서 기반 추론 및 차트 해석 부문에서 모든 모델 중 가장 높은 점수를 기록했습니다.
  • Memory: Slay the Spire 테스트에서 지속적인 파일 기반 메모리는 Fable 5의 성능을 Opus 4.8 대비 세 배 향상시켰습니다.

안전 프레임워크 및 보호 조치

Mythos-클래스 모델은 사이버 보안 및 생물학 분야에서 상당한 위험을 초래하므로, Anthropic은 단계적 안전 시스템을 구현했습니다.

폴백 메커니즘

Fable 5는 별도의 AI 분류기를 사용해 잠재적 오용을 감지합니다. 요청이 사이버 보안, 생물학, 화학 또는 증류와 관련된 것으로 표시되면 시스템은 자동으로 쿼리를 Claude Opus 4.8으로 라우팅합니다. 이를 통해 사용자는 완전 거부 대신 높은 역량을 가진 모델의 응답을 받게 되며, Anthropic은 이러한 보호 조치를 보수적으로 조정했으며 세션의 5% 미만에서 오탐이 발생할 수 있다고 밝혔습니다.

구체적 위험 영역

  • Cybersecurity: 분류기는 Fable 5가 정찰 및 횡 이동과 같은 에이전트 해킹 작업을 수행하지 못하도록 방지합니다.
  • Biology and Chemistry: 생물학 연구의 이중 사용 특성으로 인해 해당 분야의 대부분 요청은 위험한 병원체 생성을 방지하기 위해 Opus 4.8으로 폴백됩니다.
  • Distillation: 경쟁 모델 훈련을 위한 능력 추출을 방지하기 위해 증류 시도도 Opus 4.8으로 라우팅됩니다.
  • LLM Development: 모델은 최전선 LLM 개발(예: 사전 훈련 파이프라인) 요청에 대한 효율성을 의도적으로 제한하여 경쟁 모델의 가속을 방지합니다.

가격 및 이용 가능성

Claude Fable 5는 Claude API와 구독 플랜을 통해 이용할 수 있습니다.

  • Pricing: 입력 토큰 백만당 $10, 출력 토큰 백만당 $50.
  • Subscription Access: Fable 5는 6월 22일까지 Pro, Max, Team 플랜에 추가 비용 없이 포함됩니다. 해당 날짜 이후에는 사용량에 따라 크레딧이 필요하며, 용량이 허용되는 대로 구독의 표준 부분으로 복구될 예정입니다.
  • Data Retention: 새로운 정책에 따라 Mythos-클래스 모델의 모든 트래픽은 안전 및 공격 방어 목적을 위해 30일간 보관되며, 이 데이터는 학습에 사용되지 않습니다.

커뮤니티 인사이트 및 비판적 피드백

Hacker News의 사용자 토론은 모델의 추론 능력에 감탄하는 사람들과 제약에 좌절하는 사람들 사이의 갈등을 강조합니다.

"제가 이 모델을 사용해 본 지 얼마 되지 않았지만... 정말 강력합니다. 몇 달 동안 미뤄왔던 매우 어려운 문제들을 던져보니, 모델이 아주 기쁘게 해결해 줍니다."

  • Over-aggressive Filtering: 많은 사용자들이 GPU 드라이버 작성이나 DNA 결과 분석과 같은 무해한 작업조차 사이버 보안 또는 생물학 필터에 걸려 Opus 4.8으로 폴백된다고 보고했습니다.
  • Anti-competitive Behavior: 일부 사용자는 Anthropic이 LLM 개발 및 생물학 지원을 제한함으로써 '안전'을 구실로 해당 분야에서 자체 상업적 이익을 보호하고 있다고 주장합니다.
  • Cost Concerns: 이전 모델에 비해 Fable 5의 토큰 비용이 높아 일부 개발자는 일상적인 프로덕션 워크플로에 사용하는 경제적 타당성을 의문시하고 있습니다.

Sources