Claude Sonnet 5.5 發行說明

Claude Sonnet 5.5 在速度、成本和代理式程式設計效能上實現顯著提升

Claude Sonnet 5.5 是一款專為明確範圍的日常任務、錯誤修復和文件創建而設計的高性能模型。與前代 Sonnet 5 相比,其每項任務的速度快 30%,成本最多降低 30%,同時在代理式能力方面實現重大躍進,特別是在程式設計和專業知識工作領域。

性能基準與功能

Sonnet 5.5 在多項關鍵評估中對 Sonnet 5 有顯著改進,部分表現已接近更強大的 Claude Opus 5.5 水準。

代理式程式設計與電腦使用

Sonnet 5.5 在代理式程式設計方面實現巨大突破,在 Terminal-Bench 4.0 上得分 70.6%,遠高於 Sonnet 5 的 10.3%。它在 OSWorld 2.1(80.1% 部分正確)和 CursorBench 4.0(55.5%)上表現出色,後者得分僅比 Opus 5.5 低兩分。

知識工作與推理能力

在測試 44 種職業真實任務的 GDPval-AA 基準上,Sonnet 5.5 得分 1844,幾乎與 Opus 5.5(1846)持平,遠超 Sonnet 5(1449)。它在長遠知識工作和視覺圖表識別方面也超越 GPT-6 Sol(Chartography 上得 61.6%)。

比較表格

基準 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
FrontierCode 1.1 (Main) 46.2% (Max)² 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487⁴
Humanity's Last Exam 64.5% (tools) 54.9% (tools) 67.7% (tools) —
OSWorld 2.1 80.1% (partial) 57.0% (partial) 81.8% (partial) —
Chartography 61.6% (no tools) 15.6% (no tools) 64.4% (no tools) 53.6%⁴

¹ 註:Terminal-Bench 的差距部分歸因於 Opus 5.5 的安全機制回退率較高(10%),而 Sonnet 5.5 僅為 1.5%。

成本與效率

Sonnet 5.5 維持與 Sonnet 5 相同的每 token 定價,但因完成相同任務所需的 token 數更少,因此每項任務的總成本降低。

定價結構

每 100 萬 token 價格 Claude Sonnet 5.5 Claude Opus 5.5
快取讀取 $0.20 $0.20
快取寫入 $2.50 $5
輸入 token $2 $4
輸出 token $10 $20

效率提升

  • 速度:輸出生成速度比 Sonnet 5 快 30% 以上。
  • 任務成本:因 token 效率提升,每項任務成本最多降低 30%。
  • 努力等級:使用者可調整努力等級(低、中、高、X高、最大),以在速度與成本之間平衡品質。中等為 Claude 應用的預設值。

安全性、對齊與防護機制

Sonnet 5.5 引入先進防護機制,以匹配其提升的能力,特別是在資安領域。

  • 資安:由於能力與 Opus 5.5 相當,Sonnet 5.5 是首款推出時即具備資安防護的 Sonnet 模型。高風險請求將回退至 Sonnet 5。
  • 蒸餾防護:為防止透過工業級攻擊提取模型能力,Sonnet 5.5 加入安全分類器,防止推理內容被提取,並擴展「保留思考」機制。
  • 對齊:自動行為審計顯示,Sonnet 5.5 在誠實度、抗濫用能力與對齊表現上與 Sonnet 5 相當或更佳。

社群見解與反駁意見

儘管官方基準表現強勁,Hacker News 的社群反饋也指出若干實際疑慮與觀察:

  • 價值主張 vs. Opus:多位使用者質疑 Sonnet 5.5 在高努力等級下的實用性,指出 Opus 5.5 常以類似或更低的每任務成本提供更高準確度。
  • 思考 token 限制:部分使用者報告,在「最大」努力等級下,模型可能耗盡 128,000 token 的思考上限,卻仍未產生最終回應。
  • 防護機制摩擦:參與 Cyber Verification Program 的使用者指出,防護機制可能過於激進,將授權的獎金工作誤標為 Cyber 違規。
  • 效能退化:部分使用者報告在特定小眾領域出現效能退化,例如冷門程式語言,Sonnet 5.5 比 Sonnet 5 更不願意持續嘗試。
  • 競爭格局:評論者指出,雖然 Sonnet 5.5 比 Sonnet 5 有顯著進步,但其成本仍遠高於 DeepSeek 或 OpenAI 的 Luna 等競爭模型。

"在 Epic 的早期測試中,Claude Sonnet 5.5 清楚達到了您對高階模型的預期品質標準……新模型能處理數萬行遊戲系統架構程式碼,保持回應迅速,處理數小時的任務,且所需指令更為簡潔。" — Daniel Vogel,Epic Games 首席運營官

Sources

相關