Anthropic Claude Sonnet 4.5 發佈:頂尖的程式碼編寫模型與全新開發者工具
TL;DR
Claude Sonnet 4.5 是 Anthropic 最新的前沿模型,提供迄今最強大的程式碼編寫、推理與電腦使用能力,並隨附一系列產品升級——包括 Claude Code 中的檢查點(checkpoints)、VS Code 擴充功能、新的上下文編輯工具,以及開源的 Claude Agent SDK。
Claude Sonnet 4.5 是什麼
- 頂尖的程式碼編寫模型 – 在 SWE-bench Verified 基準測試中領先,並能在複雜、多步驟任務中保持專注超過 30 小時。
- 頂尖的電腦使用效能 – 在 OSWorld 取得 61.4% 的分數,相較於僅四個月前的 Sonnet 4 有顯著提升。
- 改進的推理與數學能力 – 在公開評估套件中展現出巨大增長(參見公告中的基準測試表)。
- 最符合對齊原則的前沿模型 – 安全訓練減少了諂媚、欺騙、權力尋求以及提示詞注入(prompt-injection)的漏洞。
- 價格不變 – 每百萬輸入/輸出 token 為 $3 / $15,與 Claude Sonnet 4 相同。
核心技術進展
程式碼編寫與長程任務
- 在長達 30 多小時的自主編碼過程中保持連貫性,使工程師能夠交付長達數月的架構工作。
- 並行工具執行(Parallel tool execution)能最大化每個上下文窗口(context window)內的動作,允許同時執行多個 bash 命令。
- 內部基準測試報告,在 Anthropic 的程式碼編輯測試集中,錯誤率從 9% 下降至 0%。
電腦使用 (OSWorld)
- 在網頁導航、試算表操作與檔案建立等真實世界的電腦任務中,達到 61.4% 的成功率。
- 在 Claude for Chrome 擴充功能中得到展示,該模型可以直接在瀏覽器中填寫試算表、導航網站並生成簡報。
推理與數學
- 在廣泛的推理與數學評估中表現優於先前的 Claude 模型(參見發佈的基準測試表)。
- 金融、法律、醫學與 STEM 領域的專家表示,與舊模型(包括 Opus 4.1)相比,其知識與推理能力大幅提升。
對齊與安全
- 自動化行為審計分數顯示,欺騙性、諂媚性、權力尋求與妄想性輸出較少發生。
- 針對代理型(agentic)與電腦使用能力,大幅提升了對提示詞注入(prompt-injection)的抵抗力。
- 部署於 Anthropic 的 AI Safety Level 3 (ASL-3) 框架下,其 CBRN 分類器已進行優化,自最初發佈以來,誤報率降低了十倍。
與 Sonnet 4.5 一起發佈的產品升級
Claude Code
- 檢查點 (Checkpoints):使用者可以儲存進度並立即回滾到先前的狀態。
- 更新後的終端機 UI 以及 原生 VS Code 擴充功能,實現無縫開發。
- 上下文編輯與記憶工具(透過 Claude API)使代理程式能運行更久且處理更複雜的任務。
Claude Apps
- 在對話中直接整合了 程式碼執行 與 檔案建立(試算表、簡報、文件)功能。
- Claude for Chrome 擴充功能現在已開放給已加入候補名單的 Max 使用者。
Claude Agent SDK
- 開源基礎設施,為 Claude Code 提供動力,現在已開放給開發者建立自定義代理程式。
- 處理長時程記憶管理、權限系統與子代理程式協調。
- 承諾在非程式碼編寫任務中也具備類似能力,將模型的實用性擴展至軟體開發之外。
早期客戶回饋(精選摘錄)
"We're seeing state-of-the-art coding performance from Claude Sonnet 4.5, with significant improvements on longer horizon tasks. It reinforces why many developers using Cursor choose Claude for solving their most complex problems."
"Claude Sonnet 4.5 amplifies GitHub Copilot's core strengths – multi-step reasoning and code comprehension are markedly better, enabling agentic experiences that handle complex, codebase-spanning tasks."
"Claude Sonnet 4.5 reduced average vulnerability intake time for our security agents by 44% while improving accuracy by 25%, helping us lower risk for businesses.
"We're going from a 9% error rate on Sonnet 4 to 0% on our internal code-editing benchmark."
"Claude Sonnet 4.5 increased planning performance by 18% and end-to-end eval scores by 12% for the Devin system – the biggest jump since Claude Sonnet 3.6."
研究預覽:使用 Claude Imagine
- 一個臨時的演示,Claude 會在沒有預先編寫程式碼的情況下即時生成軟體,展示實時適應能力。
- Max 使用者訂閱者可在
claude.ai/imagine體驗五天。
如何存取 Sonnet 4.5
- API: 使用模型識別碼
claude-sonnet-4-5透過 Claude API。 - Apps: 所有付費 Claude app 計劃方案,現在都包含程式碼執行與檔案建立功能。
- Developer Platform: Claude Agent SDK 與更新後的平台文件,現在已公開發佈。
為什麼這很重要
Claude Sonnet 4.5 推動了 AI 輔助軟體開發的邊界,使自主代理程式能以先前未見過的水平進行推理、編碼與電腦使用。同時發佈的開發者工具(檢查點、VS Code 擴充功能、Agent SDK)降低了建立生產級 AI 代理程式的開發門檻,潛在性地重塑塑構建、審計與維護軟體的方式,橫跨跨產業鏈。
Sources
- OriginalIntroducing Claude Sonnet 4.5
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch