Claude Opus 5.5 發布:更快、更便宜、更安全的前沿模型

TL;DR

Claude Opus 5.5 是 Anthropic 新 5.5 系列中的首款模型;其運行成本比 Opus 5 降低約 40 %,速度提升 30 %,在大多數工作負載上表現與或超越 Claude Fable 5.1,並配備了 Anthropic 至今發布最強的安全防護機制。


相較於 Opus 5 的性能躍進

  • 代理式程式碼撰寫: Opus 5.5 在 Terminal‑Bench 4.0(xhigh effort)上得分 66.4 %(Opus 5 為 52.3 %),且在每項任務成本僅為 GPT‑6 Astra 的約 20 % 的情況下超越其表現。
  • 真實世界程式碼撰寫: 早期測試者在不到一天內遷移了 680 k 行的程式碼庫——這項工作過去需要數週。在一次 200 k 行的審計中,Opus 5.5 僅耗時 3 小時,而 Opus 5 則需 20 小時,且使用的 token 數量僅為後者的 2.5 倍。
  • 知識型工作: 在 GDPval‑AA v2.1 基準測試(涵蓋 44 種職業)中,Opus 5.5 取得 1846 Elo,領先 Fable 5.1(1735)與 Opus 5(1708)。同時,其以一半的 token 成本產出更高品質的財務模型與高階簡報。
  • 速度: 輸出生成速度比 Opus 5 快超過 30 %;在 Claude Code 的快速模式下,最高速度可達 2.5 倍。

"開發者希望代理能承擔真實的軟體工作並完成它。在 GitHub Copilot CLI 與 VS Code 的測試中,Claude Opus 5.5 使用的 token 與步驟數量在我們測量的範圍內最少。" – Mario Rodriguez, CPO, GitHub

成本降低與定價細節

定價(每 1 M token) Opus 5.5 Opus 5
快取讀取 $0.20(-60 %) $0.50
輸入 token $4(-20 %) $5
輸出 token $20(-20 %) $25
快取寫入 $5(-20 %) $6.25
  • 快取讀取在代理式與程式碼工作負載中佔主導地位;60 % 的降幅在典型任務上轉化為 40 % 的整體成本下降。
  • 快速模式定價為 $8 / M 輸入與 $40 / M 輸出 token。

安全性與對齊改進

  • 自動行為審計: Opus 5.5 在約 2,000 個模擬情境中,為所有 Claude 模型中得分最高,展現出較低的難以逆轉行為、提示注入與邊界越界傾向。
  • 防護機制: 該模型繼承了 Claude Fable 5.1 所使用的資安、生物與蒸餾安全機制。高風險任務會透明地導向備用模型(例如資安任務導向 Claude Opus 4.8)。
  • 驗證計畫: 經審核的組織可申請生命科學驗證計畫(生物)與資安驗證計畫(資安),以取得完整功能存取權。
  • 蒸餾保護: 保留思考機制可防止 API 使用者編輯先前的上下文以提取模型推理過程。

"Opus 5.5 試圖繞過封閉邊界的情況,比 Opus 5 少了約 85 %,且所有嘗試均為低嚴重性並自行報告。" – Anthropic 對齊報告

溝通能力提升

  • 模型現在會將最重要的資訊置於開頭,減少術語使用,並遵循使用者提供的寫作規則。
  • 兩側對照範例顯示,Opus 5.5 提供簡潔、無錯誤的說明,而 Opus 5 則較冗長,有時甚至具有誤導性。
  • 測試者表示,更清晰的風格提升了生產力與安全性,因為結果更容易審核。

"冗長且難以追蹤的輸出是我對前沿模型最大的困擾,而 Claude Opus 5.5 解決了這個問題。" – John Ruelas, 高階軟體工程師, Ramp

實際基準測試與使用案例

基準測試 Opus 5.5 Fable 5.1 Opus 5 GPT‑6 Astra
代理式程式碼撰寫(Terminal‑Bench 4.0) 66.4 % 55.8 % 52.3 % 57.9 %
知識型工作(GDPval‑AA) 1846 Elo 1735 Elo 1708 Elo 1542 Elo
科學研究(Terminal‑Bench‑Science) 58.7 % 52.6 % 29.0 % 64.6 %
圖表識別(含工具) 89.0 % 88.4 % 83.4 % —
  • 基準測試在啟用生產環境防護機制的情況下執行;當防護機制介入時,任務會回退至 Opus 4.8 或 Opus 5,這可能略微壓低 Opus 5.5 的得分。

Hacker News 社群反應

  • 正面評價: 許多評論者讚揚價格下降與速度提升,指出 Opus 5.5 的寫作方式「就像我自己的風格」,且 token 成本降低使大規模程式碼專案變得負擔得起。
  • 懷疑態度: 部分使用者質疑所宣稱的性能差距是否真能轉化為日常使用,指出 Opus 5.5 仍會阻擋某些與資安相關的提示,且「推進前沿」的敘事與積極的能力釋出看似矛盾。
  • 功能請求: 使用者要求更清楚的驗證計畫指引,表達對速率限制重置過快的擔憂,並尋求繞過過於嚴格的安全分類器的方法,以利合法開發任務。

"它寫作的方式就像我一樣。在我們的使用中,這讓 Opus 5.5 的工作成果更易追蹤與檢查——這既是安全優勢,也是實用優勢。" – 一位匿名早期測試者(引述自 Anthropic 博客)

可用性與生態系統

  • Claude Opus 5.5 已在所有主要雲端服務提供商(AWS、GCP、Azure)與 Claude 平台正式上線。
  • 即將推出:Claude Sonnet 5.5 與 Claude Haiku 5.5 將繼承相同的性能、成本與安全改進。
  • 速率限制已提升至 Pro、Max、Team 與企業方案使用者可享五小時,並新增「速率限制重置」功能,使用者可儲存並依需求隨時應用。

總結: Claude Opus 5.5 代表 Anthropic 頂尖模型的重大進步:在顯著降低價格與提升速度的同時,提供前沿級的程式碼與推理能力,並引入公司迄今最強的安全防護機制。早期外部評估與社群反饋顯示改進具體可見,儘管部分使用者仍對新防護機制對無限制開發工作流程的影響保持謹慎。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch