Claude Opus 5 發佈說明

Anthropic 已發佈 Claude Opus 5,這是一款專為高效日常使用而設計的模型,能以一半的單次任務成本提供接近前沿(Frontier)的智能(接近 Claude Fable 5)。它現在是 Claude Max 的預設模型,也是 Claude Pro 上最強大的可用模型。

程式碼編寫與知識工作領域的頂尖性能

Claude Opus 5 在軟體工程和問題解決的幾項關鍵評估中確立了新的頂尖(State-of-the-art)成果,通常以更低的成本超越前代模型和競爭對手。

軟體工程基準測試

  • Frontier-Bench v0.1: Opus 5 超越了所有其他模型,且性能是 Opus 4.8 的兩倍以上,同時降低了單次任務的成本。
  • CursorBench 3.2: 在最大強度下,Opus 5 以一半的單次任務成本,表現達到 Fable 5 峰值分數的 0.5% 以內。在給定的成本下,它在 high、xhigh 和 max 努力等級上超越了所有其他模型。
  • OSWorld 2.0: Opus 5 在任何給定成本下都優於其他所有模型,並以約三分之一的成本超過了 Fable 5 的最佳結果。

知識工作與問題解決

  • ARC-AGI 3: 在這項新穎的問題解決評估中,Opus 5 的得分比次優模型高出三倍。
  • Zapier AutomationBench: 在相同的單次任務成本下,Opus 5 的通過率約為次優模型的 1.5 倍。即使在最低努力設置下,它通過的任務也比任何其他模型都多。
  • Frontier-Bench and GDPval-AA: Opus 5 是這些程式碼編寫和知識工作評估中的新頂尖標準。

科學研究與視覺能力

Opus 5 在科學研究(特別是在生命科學領域)方面引入了顯著改進,並增強了視覺輸出能力。

生命科學改進

Opus 5 在所有生命科學評估中均優於 Opus 4.8,包括生物資訊學、結構生物學和有機化學。關鍵進展包括:

  • 有機化學: 在從光譜數據推斷分子結構方面,比 Opus 4.8 提高了 10.2 個百分點。
  • 蛋白質研究: 在預測蛋白質序列變異如何影響功能方面,提高了 7.7 個百分點。

代理行為與實際應用

Claude Opus 5 展示了更高的代理性(Agency)、周密性,以及透過迭代驗證自身工作的能力。

技術案例研究

  • 自主工具化: 在一個 Frontier-Bench 任務中,當 Opus 5 被拒絕直接查看能力時,它編寫了自己的電腦視覺流水線,從原始像素中提取幾何圖形以重建 3D FreeCAD 模型。
  • 錯誤修復: Opus 5 識別出一個熱門開源套件管理器中真實錯誤的根本原因,並修復了先前社群補丁遺漏的邊緣情況。
  • 基礎設施開發: 一位交易公司的工程師使用 Opus 5 在單次對話中構建了市場數據饋送,包括創建用於驗證的自有測試框架。

行業回饋

早期訪問合作夥伴強調了其特定優勢:

  • Devin: 指出其在困難的除錯和根本原因分析方面的強項。
  • Lovable: 報告在最困難的代理編碼任務上比 Opus 4.7 有 22% 的改進,且變異性更低。
  • Box: 發現整體性能比 Opus 4.8 提升了 8%,數據分析提升了 11%,盡職調查工作流提升了 17%。
  • 法律代理: 觀察到與最大推理等級相似的性能,同時產生的 token 比 Opus 4.8 少 26%。

對齊、安全與網絡安全

Opus 5 被描述為 Anthropic 迄今為止對齊程度最高的模型,比 Opus 4.8、Sonnet 5 或 Fable 5 更嚴格地遵循 Claude 的憲法(Constitution)。

行為審計與風險緩解

  • 對齊分數: 在自動化行為審計中,Opus 5 在整體失調行為方面的得分為 2.3,是近期模型中最低的。
  • 網絡安全限制: 雖然 Opus 5 在識別漏洞方面接近 Mythos 5,但在漏洞利用方面仍大幅落後於 Mythos 5(如 OSS-Fuzz 基準測試所示)。
  • 生物研究: Opus 5 是目前通用科學研究能力最強的模型,但在長期自主研究任務方面仍落後於 Mythos 5。

防護措施與分類器

  • 網絡分類器: 這些分類器比 Fable 5 的限制較少,允許在源代碼中發現漏洞,但會攔截基於二進制的掃描、滲透測試和漏洞利用生成。預計這些分類器的干預次數會比 Fable 5 少 85%。
  • 回退機制: 在 Opus 5 或 Fable 5 上被安全分類器標記的請求,現在可以透過 API 自動路由到另一個模型。

定價與可用性

Claude Opus 5 已在所有平台上推出,定價如下:

  • 輸入 Token: 每百萬 token 5 美元。
  • 輸出 Token: 每百萬 token 25 美元。
  • 快速模式: 以兩倍的基礎價格提供,提供約 2.5 倍的預設速度。

Beta 功能發佈

  • 對話中工具變更: 開發者現在可以在對話中修改可用工具,而不會使提示緩存(Prompt Cache)失效。
  • 自動回退: API 用戶可以將被標記的請求路由到不同的模型以避免被攔截。

Sources

相關