Claude Fable 5.1 和 Claude Mythos 5.1 發行說明
Anthropic 發布了 Claude Fable 5.1 和 Claude Mythos 5.1,這兩款模型專為高階程式設計、知識工作與科學研究而設計。儘管兩款模型擁有相同的底層架構,但在安全防護設定上有所不同:Fable 5.1 是一般可用版本,而 Mythos 5.1 僅限於資安與生命科學專業人士的可信訪問計畫使用。
成本降低與 API 定價
Claude Fable 5.1 引入了快取讀取成本的顯著降低,將成本減少 75%,降至每百萬個 token 僅需 $0.25。此變更特別針對長時間運行的代理工作流程,其中模型會頻繁重新讀取已處理的上下文。
- 典型工作負載: 相較於 Fable 5,預估整體成本降低 25%。
- 代理工作流程: 由於快取讀取量龐大,潛在節省高達 45%。
- 標準定價: 輸入 token 仍為每百萬個 $10,輸出 token 為每百萬個 $50。
科學研究與運算能力
Claude Mythos 5.1 在分子設計與計算生物學方面展現出先進能力,經常超越人類專家或現有的開源工具。
分子設計與生物學
在蛋白質設計方面,Mythos 5.1 在設計高親和力結合劑時,於 12 個目標上達成接近 50% 的成功率,遠高於當前蛋白質設計實務中常見的 10-15% 成功率。此外,該模型透過撰寫自訂的 GPU 核心,優化了七個開源深度學習模型,使推論速度提升最高達 2.5 倍,並降低 GPU 成本 30-60%。
行星科學
Claude Fable 5.1 被用來製作金星三分之一地區的高解析度高程地圖,利用了 30 年前 NASA Magellan 的雷達影像。所產生的地圖細節可達 2-3 公里(相比過去的 10-20 公里),並提升高度準確度最高達 25%。
性能基準測試
Fable 5.1 在代理型科學研究與程式設計方面,相較於 Fable 5 及其他前沿模型有顯著提升。
| 基準測試 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| 代理程式設計 (Terminal-Bench 4.0) | 55.8% | 42.0% | 52.3% | 37.3% |
| 知識工作 (GDPval-AA v2) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (部分) | 77.9% | 72.9% | 75.4% | — |
| 人類最後一場考試 (無工具) | 60.9% | 57.8% | 56.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
注意:Mythos 5.1 在 Terminal-Bench 4.0 上得分为 60.9%。
隱私與企業安全防護
Anthropic 將推出企業前沿防護系統(EFS),此系統在維持檢測惡意使用能力的同時,提供零資料保留政策的隱私保障。EFS 將資料儲存在完全由客戶控制的雲端基礎設施中,而非 Anthropic 所有。
- 可用性: 將於 2026 年秋季起分階段在 AWS、Google Cloud 與 Microsoft Azure 上推出。
- 過渡方案: 符合資格的客戶可在 EFS 完全部署前,使用 Fable 5.1 並享有零資料保留。
安全性與對齊
資安與生物學防護
Fable 5.1 在資安任務中將誤報率降低 60%,並允許用於防禦性目的的軟體漏洞識別。然而,對於雙重用途任務(如漏洞利用產生與滲透測試),仍會導向 Opus 模型。在生物學方面,針對良性請求(醫療/基礎生物學)的防護觸發次數,相比 Fable 5 降低了 85%。
反蒸餾與水印技術
為防止模型能力被非法提取,Fable 5.1 實施了加強版的反蒸餾機制。新 API 帳戶無法再手動編輯多輪對話中的先前上下文,同時保留模型的思考記錄。
此外,為符合歐盟 AI 法案要求,Anthropic 已在文字輸出中實施不可見水印。目前檢測 API 正處於私密預覽階段,僅對監管機構、執法單位與符合資格的組織開放。
社群見解與反駁意見
Hacker News 上的使用者與開發者提供了混合的質性回饋與技術批判:
- 寫作風格: 有些使用者指出語氣更自然,減少陳腔濫調,但也有意見認為輸出變得更密集且不夠簡潔。
- 前沿進展的終點: 一些批評者質疑,除科學領域外,基準測試的邊際提升是否暗示前沿模型進展已達平台期。
- 成本與價值: 儘管有快取折扣,部分開發者仍認為其成本對一般程式代理而言仍過高,相較於 DeepSeek 或 GLM 等較便宜的替代方案。
- 技術細節: 使用者報告 Fable 5.1 對於小幅度修改更傾向於重寫整個檔案,導致 token 消耗增加。Anthropic 建議加入特定系統提示指令,以鼓勵精準修改。
"在內部基準測試中,Claude Fable 5.1 解決我們程式設計問題的能力,超過 Fable 5 或 Opus 5,並在交易直覺方面達到最尖端水準。" — Craig Falls,Jane Street Capital 量化研究主管
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch