Anthropic Claude Sonnet 4.6 發佈:能力升級與 1M‑token 上下文
TL;DR
Claude Sonnet 4.6 現在已成為 Anthropic Free、Pro 和 Claude Cowork 方案的預設模型,在提供顯著提升的程式碼編寫、電腦使用、長上下文推理和代理規劃能力的同時,還提供了 1 百萬‑token 的測試版上下文窗口——且價格與 Sonnet 4.5 相同的每百萬 token 3/15 美元。
核心技術升級
全面技能升級 – Sonnet 4.6 改進了程式碼編寫、電腦使用、長上下文推理、代理規劃、知識工作和設計。據報導,該模型的指令遵循一致性與減少幻覺的能力已超越其前代產品,甚至超越了舊有的 Opus 4.5 前沿模型。
1 M‑token 上下文窗口 (beta) – 擴展後的窗口可以在單次請求中容納整個程式碼庫、冗長的合約或數十篇研究論文,且模型在該長度下展現出有效的推理能力,如 Vending‑Bench Arena 評估所示。
安全性增強 – 廣泛的安全性評估顯示,Sonnet 4.6 與最近的 Claude 模型一樣安全,甚至更安全,具有「溫暖、誠實、親社會」的性格,且沒有重大的高風險失調問題。與 Sonnet 4.5 相比,對提示詞注入(Prompt-injection)的抵抗力也有顯著提升。
電腦使用能力
從實驗階段邁向生產級 – 自 Anthropic 在 2024 年 10 月推出首個通用型電腦使用模型以來,Sonnet 系列模型在 OSWorld 基準測試中穩步攀升。Sonnet 4.6 現在在複雜試算表導航和多步驟網頁表單填寫等任務上達到了人類水平的表現。
基準測試證據 – OSWorld‑Verified 分數(2025 年 7 月發佈)顯示,Sonnet 4.6 在數百項實際軟體任務(Chrome、LibreOffice、VS Code 等)中表現優於早期的 Sonnet 版本。
風險緩解 – 提示詞注入攻擊仍是一個考量因素;然而,安全性測試顯示 Sonnet 4.6 的抵抗力與 Opus 4.6 相當。Anthropic 在其 API 文件中提供了緩解指南。
基準測試與用戶端表現
| 評估項目 | 相對表現 | 顯著觀察 |
|---|---|---|
| Claude Code (coding) | 約 70% 的時間優於 Sonnet 4.5;59% 的時間優於 Opus 4.5 | 更好的上下文閱讀能力、更少的重複邏輯、更少的幻覺 |
| OfficeQA (企業文件推理) | 與 Opus 4.6 持平 | 文件理解工作負載的重大升級 |
| Vending‑Bench Arena (長週期商業模擬) | 透過早期大量投入並隨後轉向盈利,表現優於 Sonnet 4.5 | 展示了跨數月週期的戰略規劃能力 |
| OSWorld‑Verified (電腦使用) | Sonnet 系列中得分最高;在合作夥伴保險基準測試中表現最佳 (94% 準確率) |
客戶回饋 – 在多家合作夥伴(Databricks、Replit、Cursor、GitHub、Cognition、Windsurf、Hebbia、Box、Pace、Bolt、Rakuten、Zapier、Convey、Triple Whale、Harvey)中,Sonnet 4.6 因以下優點受到讚譽:
- 更精緻的視覺輸出與設計感
- 更快地解決大型程式碼庫中的複雜程式碼修復問題
- 提升了錯誤檢測與審核吞吐量
- 在金融服務基準測試中具有更高的答案匹配率
- 在合約路由與 CRM 協調中具有更強的多步驟推理能力
產品與 API 增強
- Claude Platform 已支援自適應與擴展思考,並提供測試版的上下文壓縮功能,可自動摘要較舊的對話輪次。
- Web‑search 與 fetch 工具現在會生成並執行過濾程式碼,僅在上下文中保留相關內容,從而提高 token 效率。
- 工具套件 – 程式碼執行、記憶體、程式化工具調用、工具搜尋和工具使用範例已全面開放。
- Excel 中的 Claude – MCP 連接器可實現從 S&P Global、LSEG、PitchBook、Moody’s、FactSet 等進行無縫數據提取,無需離開試算表。
可用性與遷移
Claude Sonnet 4.6 已在所有 Claude 方案、Claude Cowork、Claude Code、API 以及主要雲端平台正式上線。免費層級現在預設使用 Sonnet 4.6,並包含檔案建立、連接器、技能和上下文壓縮功能。開發者可以透過 Claude API 中的識別碼 claude-sonnet-4-6 開始使用該模型。
對用戶與市場的影響
- 具成本效益的前沿性能 – Sonnet 4.6 以較低的 Sonnet 價格提供了接近 Opus 的推理品質,擴展了重型 AI 工作負載的可行應用場景。
- 更廣泛的自動化 – 成熟的電腦使用能力降低了對自定義連接器的需求,使 AI 能夠透過 UI 與舊有軟體進行互動。
- 長上下文推理 – 1 M‑token 窗口為全文分析、廣泛的程式碼庫查詢以及先前無法實現的多輪規劃開啟了可能性。
- 安全性立場 – 持續強調安全性測試與提示詞注入緩解,強化了 Anthropic 作為負責任 AI 提供者的定位。
相關公告
- 改進 Fable 5 的生物學防護措施 – 詳情請參閱 Anthropic 部落格。
- Mariano‑Florentino (Tino) Cuéllar 加入 Anthropic 擔任全球事務長 – 公司領導層更新。
Sources
- OriginalIntroducing Sonnet 4.6
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch