Claude Fable 5.1 および Claude Mythos 5.1 リリースノート
Anthropic は、ハイエンドのコーディング、知識作業、科学的研究に特化した Claude Fable 5.1 および Claude Mythos 5.1 をリリースしました。両モデルは同じ基盤アーキテクチャを共有していますが、セーフガードの設定が異なります。Fable 5.1 は一般提供版であり、Mythos 5.1 はサイバーセキュリティおよびライフサイエンスの専門家向けに信頼されたアクセスプログラムに限定されています。
コスト削減と API 価格
Claude Fable 5.1 はキャッシュ読み取りのコストを 75% 削減し、100万トークンあたり $0.25 にまで引き下げました。この変更は、モデルが処理済みコンテキストを頻繁に再読み込みする長時間実行のエージェントワークフローをターゲットとしています。
- 通常のワークロード: Fable 5 と比較して全体で約 25% のコスト削減が見込まれます。
- エージェントワークフロー: キャッシュ読み取りの量が多いため、最大 45% のコスト削減が可能となります。
- 標準価格: 入力トークンは 100万トークンあたり $10、出力トークンは 100万トークンあたり $50のままです。
科学研究および計算能力
Claude Mythos 5.1 は分子設計および計算生物学において、人間の専門家や既存のオープンソースツールを上回る高度な能力を示しています。
分子設計と生物学
タンパク質設計において、Mythos 5.1 は 12 のターゲットに対して高親和性バインダーを設計する際、ほぼ 50% のヒット率を達成しました。これは現在のタンパク質設計実務における通常の 10-15% のヒット率を大幅に上回ります。さらに、モデルはカスタム GPU カーネルを記述することで、7 つのオープンソースのディープラーニングモデルを最適化し、推論速度を最大 2.5 倍に向上させ、GPU コストを 30-60% 削減しました。
行星科学
Claude Fable 5.1 は、30 年前に NASA のマゼラン計画で取得されたレーダー画像を活用し、金星の 1/3 の高解像度標高地図を作成しました。この地図は、従来の 10-20 キロメートルから 2-3 キロメートルまで詳細を再現し、高さの精度を最大 25% 向上させました。
パフォーマンスベンチマーク
Fable 5.1 は、Fable 5 や他の最先端モデルと比較して、エージェント型の科学研究およびコーディングにおいて顕著な改善を示しています。
| ベンチマーク | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Agentic Coding (Terminal-Bench 4.0) | 55.8% | 42.0% | 52.3% | 37.3% |
| Knowledge Work (GDPval-AA v2) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (Partial) | 77.9% | 72.9% | 75.4% | — |
| Humanity's Last Exam (No Tools) | 60.9% | 57.8% | 56.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
注: Mythos 5.1 は Terminal-Bench 4.0 で 60.9% を記録しました。
プライバシーとエンタープライズセーフガード
Anthropic は、ゼロデータ保持ポリシーのプライバシーを維持しつつ、悪意ある使用を検出できる能力を保つ「Enterprise Frontier Safeguards (EFS)」を導入します。EFS はデータを Anthropic ではなく顧客が完全に制御するクラウドインフラに格納します。
- 提供時期: 2026 年秋から AWS、Google Cloud、Microsoft Azure で段階的に提供開始予定。
- 一時的対応策: EFS の完全導入まで、資格のある顧客はゼロデータ保持で Fable 5.1 を利用可能。
セキュリティと整合性
サイバーセキュリティおよび生物学のセーフガード
Fable 5.1 はサイバーセキュリティタスクにおける誤検出を 60% 削減し、防御目的でのソフトウェア脆弱性の特定を許可しています。ただし、エクスプロイト生成やペネトレーションテストなど二重用途のタスクは、依然として Opus モデルにリダイレクトされます。生物学分野では、良性のリクエスト(医療・基礎生物学)に対するセーフガードの発火頻度が Fable 5 と比べて 85% 低下しています。
逆蒸留防止とウォーターマーキング
モデル機能の違法抽出を防ぐために、Fable 5.1 は強化された逆蒸留防止メカニズムを実装しています。新規 API アカウントでは、マルチターン会話において過去のコンテキストを手動で編集できず、モデルの思考トランスクリプトを保持する機能も制限されます。
さらに、EU AI Act に準拠するため、Anthropic はテキスト出力に非表示ウォーターマーキングを導入しました。検出用 API は現在、規制当局、法執行機関、資格のある組織向けにプライベートプレビュー中です。
コミュニティの洞察と反論
Hacker News 上のユーザーおよび開発者から、質的フィードバックと技術的批判が寄せられました。
- 文章スタイル: 一部のユーザーは、より自然なプローススタイルで、定型表現が減ったと指摘しましたが、他は出力がより濃密で簡潔さに欠けると主張しています。
- 最先端進歩の限界: 一部の批判者は、科学以外のベンチマークでのわずかな向上が、最先端モデルの進歩のピークに達している可能性を疑問視しています。
- コスト対価値: キャッシュ割引があるものの、一部の開発者は DeepSeek や GLM などの安価な代替品と比較して、一般的なコーディングエージェントとしてのコストが依然として高すぎるとしています。
- 技術的な癖: ユーザーは、Fable 5.1 が小さな変更に対してファイル全体を書き直す傾向があると報告しており、トークン消費が増加します。Anthropic は、手術的な編集を促すために特定のシステムプロンプトを追加することを推奨しています。
"内部ベンチマークでは、Claude Fable 5.1 は Fable 5 や Opus 5 よりも私たちのコーディング問題をより多く解決しており、トレーディングインテュイションにおいて最先端の成績を達成しています。" — Craig Falls、Jane Street Capital、定量研究部長
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch