Claude Sonnet 5.5 發行說明
Claude Sonnet 5.5 在速度、成本和代理式程式設計效能上實現顯著提升
Claude Sonnet 5.5 是一款專為明確範圍的日常任務、錯誤修復和文件創建而設計的高性能模型。與前代 Sonnet 5 相比,其每項任務的速度快 30%,成本最多降低 30%,同時在代理式能力方面實現重大躍進,特別是在程式設計和專業知識工作領域。
性能基準與功能
Sonnet 5.5 在多項關鍵評估中對 Sonnet 5 有顯著改進,部分表現已接近更強大的 Claude Opus 5.5 水準。
代理式程式設計與電腦使用
Sonnet 5.5 在代理式程式設計方面實現巨大突破,在 Terminal-Bench 4.0 上得分 70.6%,遠高於 Sonnet 5 的 10.3%。它在 OSWorld 2.1(80.1% 部分正確)和 CursorBench 4.0(55.5%)上表現出色,後者得分僅比 Opus 5.5 低兩分。
知識工作與推理能力
在測試 44 種職業真實任務的 GDPval-AA 基準上,Sonnet 5.5 得分 1844,幾乎與 Opus 5.5(1846)持平,遠超 Sonnet 5(1449)。它在長遠知識工作和視覺圖表識別方面也超越 GPT-6 Sol(Chartography 上得 61.6%)。
比較表格
| 基準 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| FrontierCode 1.1 (Main) | 46.2% (Max)² | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487⁴ |
| Humanity's Last Exam | 64.5% (tools) | 54.9% (tools) | 67.7% (tools) | — |
| OSWorld 2.1 | 80.1% (partial) | 57.0% (partial) | 81.8% (partial) | — |
| Chartography | 61.6% (no tools) | 15.6% (no tools) | 64.4% (no tools) | 53.6%⁴ |
¹ 註:Terminal-Bench 的差距部分歸因於 Opus 5.5 的安全機制回退率較高(10%),而 Sonnet 5.5 僅為 1.5%。
成本與效率
Sonnet 5.5 維持與 Sonnet 5 相同的每 token 定價,但因完成相同任務所需的 token 數更少,因此每項任務的總成本降低。
定價結構
| 每 100 萬 token 價格 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| 快取讀取 | $0.20 | $0.20 |
| 快取寫入 | $2.50 | $5 |
| 輸入 token | $2 | $4 |
| 輸出 token | $10 | $20 |
效率提升
- 速度:輸出生成速度比 Sonnet 5 快 30% 以上。
- 任務成本:因 token 效率提升,每項任務成本最多降低 30%。
- 努力等級:使用者可調整努力等級(低、中、高、X高、最大),以在速度與成本之間平衡品質。中等為 Claude 應用的預設值。
安全性、對齊與防護機制
Sonnet 5.5 引入先進防護機制,以匹配其提升的能力,特別是在資安領域。
- 資安:由於能力與 Opus 5.5 相當,Sonnet 5.5 是首款推出時即具備資安防護的 Sonnet 模型。高風險請求將回退至 Sonnet 5。
- 蒸餾防護:為防止透過工業級攻擊提取模型能力,Sonnet 5.5 加入安全分類器,防止推理內容被提取,並擴展「保留思考」機制。
- 對齊:自動行為審計顯示,Sonnet 5.5 在誠實度、抗濫用能力與對齊表現上與 Sonnet 5 相當或更佳。
社群見解與反駁意見
儘管官方基準表現強勁,Hacker News 的社群反饋也指出若干實際疑慮與觀察:
- 價值主張 vs. Opus:多位使用者質疑 Sonnet 5.5 在高努力等級下的實用性,指出 Opus 5.5 常以類似或更低的每任務成本提供更高準確度。
- 思考 token 限制:部分使用者報告,在「最大」努力等級下,模型可能耗盡 128,000 token 的思考上限,卻仍未產生最終回應。
- 防護機制摩擦:參與 Cyber Verification Program 的使用者指出,防護機制可能過於激進,將授權的獎金工作誤標為
Cyber違規。 - 效能退化:部分使用者報告在特定小眾領域出現效能退化,例如冷門程式語言,Sonnet 5.5 比 Sonnet 5 更不願意持續嘗試。
- 競爭格局:評論者指出,雖然 Sonnet 5.5 比 Sonnet 5 有顯著進步,但其成本仍遠高於 DeepSeek 或 OpenAI 的 Luna 等競爭模型。
"在 Epic 的早期測試中,Claude Sonnet 5.5 清楚達到了您對高階模型的預期品質標準……新模型能處理數萬行遊戲系統架構程式碼,保持回應迅速,處理數小時的任務,且所需指令更為簡潔。" — Daniel Vogel,Epic Games 首席運營官
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch