Anthropic Claude Sonnet 4.6 发布:能力升级与 100 万 token 上下文

概要

Claude Sonnet 4.6 现已作为 Anthropic 免费版、Pro 版及 Claude Cowork 计划的默认模型,显著提升了编码、计算机使用、长上下文推理和代理规划能力,同时提供测试版 100 万 token 上下文窗口——所有功能均保持与 Sonnet 4.5 相同的每百万 token 3 美元/15 美元定价。


核心技术升级

全面技能提升 – Sonnet 4.6 在编码、计算机使用、长上下文推理、代理规划、知识工作和设计方面均有改进。据报告,该模型在指令遵循一致性方面优于其前代产品,甚至超越了较早的 Opus 4.5 前沿模型,且幻觉现象显著减少。

100 万 token 上下文窗口(测试版) – 扩展的上下文窗口可一次性容纳整个代码库、长篇合同或数十篇研究论文,模型在该长度上展现出有效的推理能力,如 Vending-Bench Arena 评估所示。

安全增强 – 经过广泛的安全评估,Sonnet 4.6 的安全性与近期的 Claude 模型相当或更优,具有“温暖、诚实、亲社会”的性格特征,且无重大高风险对齐问题。与 Sonnet 4.5 相比,其对提示注入攻击的抵抗力也显著提升。


计算机使用能力

从实验性到生产级 – 自 Anthropic 2024 年 10 月发布首个通用计算机使用模型以来,Sonnet 系列在 OSWorld 基准测试中稳步提升。Sonnet 4.6 现已在复杂电子表格导航和多步骤网页表单填写等任务上达到人类水平表现。

基准测试证据 – 2025 年 7 月发布的 OSWorld-Verified 得分显示,Sonnet 4.6 在数百个真实软件任务(Chrome、LibreOffice、VS Code 等)中全面超越早期 Sonnet 版本。

风险缓解 – 提示注入攻击仍是潜在风险;但安全测试表明,Sonnet 4.6 的抗性与 Opus 4.6 相当。Anthropic 在其 API 文档中提供了缓解指南。


基准测试与用户可见性能

评估项目 相对性能 显著观察
Claude Code(编码) 在约 70% 的情况下优于 Sonnet 4.5;在 59% 的情况下优于 Opus 4.5 上下文理解更佳,逻辑重复更少,幻觉更少
OfficeQA(企业文档推理) 与 Opus 4.6 相当 对文档理解类工作负载有显著提升
Vending-Bench Arena(长周期业务模拟) 通过早期重投入、后期转向盈利,显著优于 Sonnet 4.5 展现了跨数月周期的战略规划能力
OSWorld-Verified(计算机使用) Sonnet 系列中得分最高;在合作伙伴保险基准测试中表现最佳(准确率 94%)

客户反馈 – 多家合作伙伴(Databricks、Replit、Cursor、GitHub、Cognition、Windsurf、Hebbia、Box、Pace、Bolt、Rakuten、Zapier、Convey、Triple Whale、Harvey)对 Sonnet 4.6 的评价包括:

  • 更精致的视觉输出和设计感
  • 在大型代码库中更快地解决复杂代码修复问题
  • 改进的缺陷检测和代码审查吞吐量
  • 在金融服务业基准测试中更高的答案匹配率
  • 在合同路由和 CRM 协调中的更强多步推理能力

产品与 API 增强功能

  • 自适应与扩展性思维 已在 Claude 平台上支持,上下文压缩功能目前处于测试阶段,可自动总结较早的对话回合。
  • 网页搜索与获取工具 现在可生成并运行过滤代码,仅将相关内容保留在上下文中,提升 token 使用效率。
  • 工具套件 – 代码执行、记忆、程序化工具调用、工具搜索和工具使用示例现已普遍可用。
  • Claude in Excel – MCP 连接器支持无缝从 S&P Global、LSEG、PitchBook、Moody’s、FactSet 等平台拉取数据,无需离开电子表格。

可用性与迁移

Claude Sonnet 4.6 已在所有 Claude 计划、Claude Cowork、Claude Code、API 及主要云平台上线。免费版现已默认使用 Sonnet 4.6,并包含文件创建、连接器、技能和上下文压缩功能。开发者可通过 Claude API 中的标识符 claude-sonnet-4-6 开始使用该模型。


对用户与市场的意义

  • 高性价比前沿性能 – Sonnet 4.6 以较低的 Sonnet 定价实现了接近 Opus 的推理质量,扩大了重型 AI 工作负载的可行应用场景。
  • 更广泛的自动化 – 成熟的计算机使用能力减少了对定制连接器的需求,使 AI 能够通过 UI 与遗留软件交互。
  • 长上下文推理 – 100 万 token 上下文窗口为完整文档分析、大规模代码库查询和多轮规划打开了新可能,这些在过去难以实现。
  • 安全态势 – 持续强调安全测试和提示注入缓解,强化了 Anthropic 作为负责任 AI 提供商的定位。

相关公告

  • 提升 Fable 5 的生物学安全防护 – 详情请见 Anthropic 官方博客。
  • Mariano-Florentino(Tino)Cuéllar 加入 Anthropic 担任首席全球事务官 – 公司领导层更新。

Sources

相关