Claude Sonnet 5 发布说明:增强的代理能力和定价

Claude Sonnet 5 为代理工作流提供更高的自主性

Claude Sonnet 5 被设计为 Sonnet 系列中最具代理性的模型,能够进行自主规划、浏览器和终端工具使用以及复杂的多步骤执行。它缩小了中档 Sonnet 模型与高端 Opus 系列模型之间的性能差距,特别针对推理、编码和知识工作方面的提升。

关键性能提升

Sonnet 5 在代理搜索(BrowseComp)和计算机使用(OSWorld-Verified)评估方面相较于 Sonnet 4.6 有显著提升。虽然 Opus 4.8 仍是追求最高准确性的最佳选择,但 Sonnet 5 通过调整 “effort levels” 让开发者在成本和性能之间取得平衡。

早期访问合作伙伴报告了在执行力方面的显著提升,包括:

  • 软件工程: 在 “messy” 的技术环境中处理持续的编码和调试。
  • 端到端自动化: 完成多部分任务(例如,更新 Salesforce 层级并发送公告),且不中断。
  • 自主错误修复: 编写复现测试并一次性实现修复,无需明确提示。
  • Brownfield 代码: 在遗留代码库中追溯故障根本原因,而不是仅修补表面症状。

安全性与网络安全防护措施

相较于 Sonnet 4.6,Sonnet 5 展示了更低的不良行为、幻觉和阿谀奉承率。它专门针对代理情境下的提示注入攻击和恶意请求进行了优化。

网络安全限制

Anthropic 明确表示,Sonnet 5 在执行危险网络安全任务方面的能力远低于 Opus 4.8 或 Mythos 5。在涉及为 Firefox 147 开发软件漏洞的评估中,Sonnet 5 未能开发出任何完整可用的漏洞。由于相较于 Sonnet 4.6 在部分成功率上略有提升——归因于整体智能的提升——Anthropic 默认启用了实时网络安全防护。

定价与可用性

Claude Sonnet 5 在所有套餐(Free、Pro、Max、Team 和 Enterprise)中均可使用,并且是 Free 和 Pro 用户的默认模型。它也已集成到 Claude Code 和 Claude Platform 中。

令牌定价

期间 输入令牌(每 1M) 输出令牌(每 1M)
Through Aug 31, 2026 $2 $10
After Aug 31, 2026 $3 $15

关于令牌化的说明: Sonnet 5 使用了更新的分词器。这导致相同的输入大约映射为比以前版本多 1.0–1.35 倍的令牌,从而影响每次请求的实际成本。

社区分析与反驳

虽然 Anthropic 将 Sonnet 5 定位为 Opus 的性价比替代方案,但来自 Hacker News 的社区反馈突显了若干关键权衡:

成本‑性能效率

多位用户认为,在更高的 effort levels 下,Sonnet 5 并非帕累托最优。

"任务成本图表告诉我,我不应在中等 effort level 以上使用 Sonnet 5——在相同成本下,Opus 的表现始终更佳。"

代理式 vs. 辅助式开发

一些开发者报告称,随着模型被优化用于 “agentic” 开发(模型主导),“assisted” 开发(人为主导)的效果出现下降。

"我发现,模型越是被优化为完全的 agentic 开发,它们在 assisted 开发方面的表现就越差,且即使有非常严格/具体的指令,它们仍常常做得过多。"

对比基准

独立测试者注意到与其他前沿模型相比,结果各不相同:

  • GLM-5.2: 部分用户报告 Sonnet 5 在编码和 agentic 能力上可与 GLM-5.2 相媲美,尽管它可能更快且更简洁。另一些人则认为它的性价比低于 GLM-5.2。
  • 可靠性: 有报告指出,Sonnet 5 可能在复杂的 HPC 核心上 “spin”,浪费令牌,而 Opus 以前能够成功处理。

Sources

相关