Claude Fable 5.1 和 Claude Mythos 5.1 發行說明

Anthropic 發布了 Claude Fable 5.1 和 Claude Mythos 5.1,這兩款模型專為高階程式設計、知識工作與科學研究而設計。儘管兩款模型擁有相同的底層架構,但在安全防護設定上有所不同:Fable 5.1 是一般可用版本,而 Mythos 5.1 僅限於資安與生命科學專業人士的可信訪問計畫使用。

成本降低與 API 定價

Claude Fable 5.1 引入了快取讀取成本的顯著降低,將成本減少 75%,降至每百萬個 token 僅需 $0.25。此變更特別針對長時間運行的代理工作流程,其中模型會頻繁重新讀取已處理的上下文。

  • 典型工作負載: 相較於 Fable 5,預估整體成本降低 25%。
  • 代理工作流程: 由於快取讀取量龐大,潛在節省高達 45%。
  • 標準定價: 輸入 token 仍為每百萬個 $10,輸出 token 為每百萬個 $50。

科學研究與運算能力

Claude Mythos 5.1 在分子設計與計算生物學方面展現出先進能力,經常超越人類專家或現有的開源工具。

分子設計與生物學

在蛋白質設計方面,Mythos 5.1 在設計高親和力結合劑時,於 12 個目標上達成接近 50% 的成功率,遠高於當前蛋白質設計實務中常見的 10-15% 成功率。此外,該模型透過撰寫自訂的 GPU 核心,優化了七個開源深度學習模型,使推論速度提升最高達 2.5 倍,並降低 GPU 成本 30-60%。

行星科學

Claude Fable 5.1 被用來製作金星三分之一地區的高解析度高程地圖,利用了 30 年前 NASA Magellan 的雷達影像。所產生的地圖細節可達 2-3 公里(相比過去的 10-20 公里),並提升高度準確度最高達 25%。

性能基準測試

Fable 5.1 在代理型科學研究與程式設計方面,相較於 Fable 5 及其他前沿模型有顯著提升。

基準測試 Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
代理程式設計 (Terminal-Bench 4.0) 55.8% 42.0% 52.3% 37.3%
知識工作 (GDPval-AA v2) 1853 1723 1824 1711
OSWorld 2.0 (部分) 77.9% 72.9% 75.4%
人類最後一場考試 (無工具) 60.9% 57.8% 56.6%
AutomationBench 31.4% 17.1% 26.9% 19.6%

注意:Mythos 5.1 在 Terminal-Bench 4.0 上得分为 60.9%。

隱私與企業安全防護

Anthropic 將推出企業前沿防護系統(EFS),此系統在維持檢測惡意使用能力的同時,提供零資料保留政策的隱私保障。EFS 將資料儲存在完全由客戶控制的雲端基礎設施中,而非 Anthropic 所有。

  • 可用性: 將於 2026 年秋季起分階段在 AWS、Google Cloud 與 Microsoft Azure 上推出。
  • 過渡方案: 符合資格的客戶可在 EFS 完全部署前,使用 Fable 5.1 並享有零資料保留。

安全性與對齊

資安與生物學防護

Fable 5.1 在資安任務中將誤報率降低 60%,並允許用於防禦性目的的軟體漏洞識別。然而,對於雙重用途任務(如漏洞利用產生與滲透測試),仍會導向 Opus 模型。在生物學方面,針對良性請求(醫療/基礎生物學)的防護觸發次數,相比 Fable 5 降低了 85%。

反蒸餾與水印技術

為防止模型能力被非法提取,Fable 5.1 實施了加強版的反蒸餾機制。新 API 帳戶無法再手動編輯多輪對話中的先前上下文,同時保留模型的思考記錄。

此外,為符合歐盟 AI 法案要求,Anthropic 已在文字輸出中實施不可見水印。目前檢測 API 正處於私密預覽階段,僅對監管機構、執法單位與符合資格的組織開放。

社群見解與反駁意見

Hacker News 上的使用者與開發者提供了混合的質性回饋與技術批判:

  • 寫作風格: 有些使用者指出語氣更自然,減少陳腔濫調,但也有意見認為輸出變得更密集且不夠簡潔。
  • 前沿進展的終點: 一些批評者質疑,除科學領域外,基準測試的邊際提升是否暗示前沿模型進展已達平台期。
  • 成本與價值: 儘管有快取折扣,部分開發者仍認為其成本對一般程式代理而言仍過高,相較於 DeepSeek 或 GLM 等較便宜的替代方案。
  • 技術細節: 使用者報告 Fable 5.1 對於小幅度修改更傾向於重寫整個檔案,導致 token 消耗增加。Anthropic 建議加入特定系統提示指令,以鼓勵精準修改。

"在內部基準測試中,Claude Fable 5.1 解決我們程式設計問題的能力,超過 Fable 5 或 Opus 5,並在交易直覺方面達到最尖端水準。" — Craig Falls,Jane Street Capital 量化研究主管

Sources

相關