Claude Sonnet 5.5 发布说明

Claude Sonnet 5.5 在速度、成本和代理编码性能方面实现显著提升

Claude Sonnet 5.5 是一款高性能模型,专为范围明确的日常任务、错误修复和文档创建而设计。相比其前代产品 Sonnet 5,它在每项任务上速度提升 30%,成本降低高达 30%,同时在代理能力方面实现重大飞跃,尤其是在编码和专业知识工作领域。

性能基准与能力

Sonnet 5.5 在多个关键评估中相比 Sonnet 5 实现了显著提升,部分性能水平已接近更强大的 Claude Opus 5.5。

代理编码与计算机使用

Sonnet 5.5 在代理编码方面表现出巨大进步,在 Terminal-Bench 4.0 上得分为 70.6%,而 Sonnet 5 仅为 10.3%。它在 OSWorld 2.1(80.1% 部分得分)和 CursorBench 4.0(55.5%)上也表现强劲,后者得分仅比 Opus 5.5 低两个百分点。

知识工作与推理能力

在测试 44 个职业真实任务的 GDPval-AA 基准测试中,Sonnet 5.5 得分为 1844,几乎与 Opus 5.5(1846)持平,远超 Sonnet 5(1449)。它在长周期知识工作和视觉图表识别方面也优于 GPT-6 Sol(Chartography 得分为 61.6%)。

对比表格

基准测试 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
FrontierCode 1.1 (Main) 46.2% (Max)² 42.4% 54.4% 49.3%
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487⁴
Humanity's Last Exam 64.5% (tools) 54.9% (tools) 67.7% (tools) —
OSWorld 2.1 80.1% (partial) 57.0% (partial) 81.8% (partial) —
Chartography 61.6% (no tools) 15.6% (no tools) 64.4% (no tools) 53.6%⁴

¹ 注:Terminal-Bench 的差距部分归因于 Opus 5.5 的安全防护回退率更高(10%),而 Sonnet 5.5 仅为 1.5%。

成本与速度效率

Sonnet 5.5 保持与 Sonnet 5 相同的每 token 定价,但通过减少完成相同任务所需的 token 数量,降低了每项任务的总成本。

定价结构

每 100 万 token 价格 Claude Sonnet 5.5 Claude Opus 5.5
缓存读取 $0.20 $0.20
缓存写入 $2.50 $5
输入 token $2 $4
输出 token $10 $20

效率提升

  • 速度: 输出生成速度比 Sonnet 5 快 30% 以上。
  • 任务成本: 由于 token 效率提升,每项任务成本比 Sonnet 5 降低高达 30%。
  • 努力等级: 用户可调整努力等级(低、中、高、X高、最大),在速度和成本之间权衡质量。中等为 Claude 应用的默认设置。

安全性、对齐性与防护措施

Sonnet 5.5 引入了先进的防护机制,以匹配其增强的能力,尤其是在网络安全领域。

  • 网络安全: 由于能力与 Opus 5.5 相当,Sonnet 5.5 是首个发布时即配备网络安全防护的 Sonnet 模型。高风险请求将回退至 Sonnet 5。
  • 蒸馏防护: 为防止通过工业级攻击提取模型能力,Sonnet 5.5 包含安全分类器,防止推理提取,并扩展了“保留思维”机制。
  • 对齐性: 自动化行为审计显示,Sonnet 5.5 在诚实性、抗滥用性及对齐性方面与 Sonnet 5 相当或更优。

社区见解与不同观点

尽管官方基准测试表现强劲,但 Hacker News 的社区反馈揭示了若干实际关切与观察:

  • 价值主张 vs. Opus: 多位用户质疑 Sonnet 5.5 在高努力等级下的实用性,指出 Opus 5.5 通常以相似或更低的成本提供更高的准确性。
  • 思考 token 限制: 部分用户报告称,在“最大”努力等级下,模型可能耗尽其 128,000 token 的思考 token 限制,却仍未生成最终响应。
  • 防护机制摩擦: 参与网络安全验证计划的用户报告称,防护机制可能过于激进,将授权的赏金工作误判为 Cyber 违规。
  • 性能退化: 部分用户报告在特定小众领域出现性能退化,例如在冷门编程语言方面,Sonnet 5.5 比 Sonnet 5 更不愿意坚持尝试。
  • 竞争格局: 评论者指出,尽管 Sonnet 5.5 相比 Sonnet 5 是巨大飞跃,但其价格仍显著高于 DeepSeek 或 OpenAI 的 Luna 等竞争模型。

"在 Epic 的早期测试中,Claude Sonnet 5.5 达到了你对更高级别模型所期望的质量标准……新模型成功处理了数万行游戏系统架构代码,保持响应迅速,能处理数小时的任务,并且在更少的指令引导下完成任务。" — Daniel Vogel, COO, Epic Games

Sources

相关