Anthropic Claude Sonnet 4.5 发布:最先进的编程模型与全新开发者工具
TL;DR
Claude Sonnet 4.5 是 Anthropic 最新的前沿模型,提供了迄今为止最强的编程、推理和计算机使用能力,并随之推出了一系列产品升级——包括 Claude Code 中的检查点(checkpoints)、VS Code 扩展、新的上下文编辑工具以及开源的 Claude Agent SDK。
Claude Sonnet 4.5 是什么
- 同类最佳编程模型 – 在 SWE-bench Verified 基准测试中处于领先地位,并能在复杂的、多步骤任务中保持超过 30 小时的专注度。
- 顶尖的计算机使用表现者 – 在 OSWorld 上获得 61.4% 的分数,相比仅四个月前的 Sonnet 4 有了大幅提升。
- 改进的推理与数学能力 – 在公开评估套件中表现出巨大增益(参见公告中的基准测试表)。
- 最符合对齐要求的前沿模型 – 安全训练减少了谄媚、欺骗、追求权力以及提示词注入(prompt-injection)漏洞。
- 价格保持不变 – 每百万输入/输出 token 为 $3 / $15,与 Claude Sonnet 4 完全一致。
核心技术进步
编程与长程任务
- 在超过 30 小时的自主编程过程中保持连贯性,使工程师能够移交长达数月的架构工作。
- 并行工具执行功能使每个上下文窗口的操作次数最大化,允许同时运行多个 bash 命令。
- 内部基准测试报告显示,在 Anthropic 的代码编辑测试集中,错误率从 9% 降至 0%。
计算机使用 (OSWorld)
- 在网页导航、电子表格操作和文件创建等现实世界的计算机任务中实现了 61.4% 的成功率。
- 在 Claude for Chrome 扩展程序中得到了展示,该模型可以直接在浏览器中填写电子表格、导航网站并生成幻灯片。
推理与数学
- 在广泛的推理和数学评估套件中表现优于之前的 Claude 模型(参见发布的基准测试表)。
- 金融、法律、医学和 STEM 领域的特定领域专家报告称,与包括 Opus 4.1 在内的旧模型相比,其知识和推理能力有了显著提升。
对齐与安全
- 自动化行为审计得分显示,欺骗性、谄媚性、追求权力以及妄想性输出的发生率较低。
- 针对智能体(agentic)和计算机使用能力的提示词注入防御能力得到了实质性提升。
- 在 Anthropic 的 AI Safety Level 3 (ASL-3) 框架下部署,配备了经过优化的 CBRN 分类器,自发布以来已将误报率降低了十倍。
随 Sonnet 4.5 发布的产品增强功能
Claude Code
- 检查点 (Checkpoints):用户可以保存进度并立即回滚到之前的状态。
- 焕新的终端 UI 以及原生 VS Code 扩展,实现无缝开发。
- 上下文编辑与记忆工具(通过 Claude API)使智能体能够运行更久并处理更高的复杂度。
Claude Apps
- 在对话中直接集成了代码执行和文件创建(电子表格、幻灯片、文档)。
- Claude for Chrome 扩展程序现在已向加入候补名单的 Max 用户开放。
Claude Agent SDK
- 为 Claude Code 提供支持的开源基础设施,现在已供开发者构建自定义智能体。
- 处理长时运行的记忆管理、权限系统和子智能体协调。
- 承诺在非编程任务中也具备类似的能力,将模型的实用性扩展到软件开发之外。
早期客户反馈(精选摘录)
"We're seeing state-of-the-art coding performance from Claude Sonnet 4.5, with significant improvements on longer horizon tasks. It reinforces why many developers using Cursor choose Claude for solving their most complex problems."
"Claude Sonnet 4.5 amplifies GitHub Copilot's core strengths – multi-step reasoning and code comprehension are markedly better, enabling agentic experiences that handle complex, codebase-spanning tasks."
"Claude Sonnet 4.5 reduced average vulnerability intake time for our security agents by 44% while improving accuracy by 25%, helping us lower risk for businesses.
"The model's edit capabilities are exceptional – we went from a 9% error rate on Sonnet 4 to 0% on our internal code-editing benchmark."
"Claude Sonnet 4.5 increased planning performance by 18% and end-to-end eval scores by 12% for the Devin system – the biggest jump since Claude Sonnet 3.6."
研究预览:使用 Claude 进行想象 (Imagine with Claude)
- 一个临时演示,Claude 在没有预先编写代码的情况下实时生成软件,展示了实时适应能力。
- Max 用户可在
claude.ai/imagine体验五天。
如何访问 Sonnet 4.5
- API:通过 Claude API 使用模型标识符
claude-sonnet-4-5。 - Apps:所有付费 Claude app 计划均包含代码执行和功能文件创建。
- Developer Platform:Claude Agent SDK 和更新后的平台文档已公开可用。
为什么这很重要
Claude Sonnet 4.5 推动了 AI 辅助软件开发的前沿沿,使自主智能体能够以一种前所未见的水平进行推理、编程和与计算机进行交互。开发者工具(检查点、VS Code 扩展、VS Code 扩展、Agent SDK)的同时发布,降低了构建生产级 AI 智能体的门槛, potentially reshaping how software is built, audited, and maintained across industries。
Sources
- OriginalIntroducing Claude Sonnet 4.5
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch