Claude Opus 5.5 發行說明
Claude Opus 5.5 在成本降低 40% 的情況下提供更高性能
Anthropic 推出了 Claude Opus 5.5,這是 Claude 5.5 系列中的首款模型。該模型在大多數任務上的表現與 Claude Fable 5.1 相當,同時與前代模型 Opus 5 相比,執行典型工作負載的成本降低了 40%,並且輸出生成速度比 Opus 5 快 30% 以上。
價格與效率
Opus 5.5 比 Opus 5 更具計算效率,因此每 token 的定價更低,且每項任務所需的 token 數量也更少。
| 每百萬 token 的價格 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| 快取讀取 | $0.20 | $0.50 |
| 輸入 token | $4 | $5 |
| 輸出 token | $20 | $25 |
| 快取寫入 | $5 | $6.25 |
對於需要更高速度的使用者,Claude Code 和 Claude Platform 提供「快速模式」,可實現最高 2.5 倍的加速,輸入 token 價格為每百萬 $8,輸出 token 價格為每百萬 $40。
智能編碼與軟體工程的進步
Claude Opus 5.5 在處理大規模、複雜的軟體工程任務方面有顯著提升,特別是在整個代碼庫的遷移與審計方面。
實際編碼表現
- 大規模遷移: 一位早期測試者在不到一天的時間內完成了一個 68 萬行代碼的遷移。
- 代碼庫審計: 在一次測試中,Opus 5.5 在不到三小時內審計並修復了一個 20 萬行的代碼庫,而 Opus 5 則需要超過 20 小時且使用了 2.5 倍以上的 token。
- 語言翻譯: 在將 HAProxy 從 C 語言翻譯為 Rust 的測試中,Opus 5.5 僅耗時 9.5 小時(Fable 5.1 為 12 小時),且成本降低了 51%。
基準測試
Opus 5.5 在智能編碼與電腦使用方面領先。在 Terminal-Bench 4.0 上,其性能與 GPT-6 Astra 相當,但成本僅為後者的約 40%。在 CursorBench 上,其表現比 GPT-5.6 Sol 高出 11 分,且成本僅為後者的約三分之一。
知識工作與研究能力
Opus 5.5 經優化,適用於高可靠性研究與財務分析,能有效減少資料密集型報告中的幻覺問題。
研究準確性
在一次內部測試中,要求根據難以查找的財報發布資料撰寫報告,18 份 Opus 5.5 的報告中有 16 份達到了零虛構數字或引用的品質標準。Fable 5.1 和 Opus 5 均未在任何一次測試中達標。
商業與財務分析
- 財務模型: 在一次虛構併購分析中,Opus 5.5 建立了更完整的財務模型,並產生了更具可讀性的執行摘要,耗時 63 分鐘(Opus 5 為 93 分鐘),成本降低 50%。
- 專業工作: 在涵蓋 44 種職業的 GDPval-AA v2.1 基準測試中,Opus 5.5 獲得 1846 Elo 分,超越 Fable 5.1(1735)與 Opus 5(1708)。
溝通與協作風格
Anthropic 已全面調整 Opus 5.5 的溝通風格,使其更自然、更簡潔。該模型現在會在回應的開頭優先呈現最重要資訊,並避免使用獨特的術語,使其在長時間工作會話中成為更有效的合作夥伴。
安全性、對齊性與防護措施
Opus 5.5 的部署以「穩步推進前沿」為重點,確保安全實踐能隨著模型能力同步演進。
對齊性與行為審計
Opus 5.5 在 Anthropic 的自動化行為審計中取得了迄今最佳的分數。它對提示注入攻擊的抵抗能力顯著增強,且更不容易執行難以逆轉的操作或繞過封閉邊界。在封閉邊界穿越測試中,其繞過邊界的嘗試次數比 Opus 5 或 Claude Mythos 5.1 低 85%。
專業領域防護措施
由於其在生物學與資安領域的高能力,Opus 5.5 採用了與 Fable 5.1 相似的防護機制:
- 資安: 多數資安任務會被重新導向至 Opus 4.8。經驗證的專業人士可申請資安驗證計畫以取得擴展存取權。
- 生物學: 生物相關工作透過生命科學驗證計畫,僅對審核通過的組織開放。
- 蒸餾防護: 為防止模型能力被提取,Opus 5.5 使用「保留思考」機制,阻止 API 使用者編輯先前的上下文以提取推理過程。
可用性
Claude Opus 5.5 可在所有平台使用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。開發者可透過 Claude Platform 使用模型識別碼 claude-opus-5-5 進行存取。