Claude Sonnet 5.5 发布说明
Claude Sonnet 5.5 在速度、成本和代理编码性能方面实现显著提升
Claude Sonnet 5.5 是一款高性能模型,专为范围明确的日常任务、错误修复和文档创建而设计。相比其前代产品 Sonnet 5,它在每项任务上速度提升 30%,成本降低高达 30%,同时在代理能力方面实现重大飞跃,尤其是在编码和专业知识工作领域。
性能基准与能力
Sonnet 5.5 在多个关键评估中相比 Sonnet 5 实现了显著提升,部分性能水平已接近更强大的 Claude Opus 5.5。
代理编码与计算机使用
Sonnet 5.5 在代理编码方面表现出巨大进步,在 Terminal-Bench 4.0 上得分为 70.6%,而 Sonnet 5 仅为 10.3%。它在 OSWorld 2.1(80.1% 部分得分)和 CursorBench 4.0(55.5%)上也表现强劲,后者得分仅比 Opus 5.5 低两个百分点。
知识工作与推理能力
在测试 44 个职业真实任务的 GDPval-AA 基准测试中,Sonnet 5.5 得分为 1844,几乎与 Opus 5.5(1846)持平,远超 Sonnet 5(1449)。它在长周期知识工作和视觉图表识别方面也优于 GPT-6 Sol(Chartography 得分为 61.6%)。
对比表格
| 基准测试 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4%¹ | — |
| FrontierCode 1.1 (Main) | 46.2% (Max)² | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | 1487⁴ |
| Humanity's Last Exam | 64.5% (tools) | 54.9% (tools) | 67.7% (tools) | — |
| OSWorld 2.1 | 80.1% (partial) | 57.0% (partial) | 81.8% (partial) | — |
| Chartography | 61.6% (no tools) | 15.6% (no tools) | 64.4% (no tools) | 53.6%⁴ |
¹ 注:Terminal-Bench 的差距部分归因于 Opus 5.5 的安全防护回退率更高(10%),而 Sonnet 5.5 仅为 1.5%。
成本与速度效率
Sonnet 5.5 保持与 Sonnet 5 相同的每 token 定价,但通过减少完成相同任务所需的 token 数量,降低了每项任务的总成本。
定价结构
| 每 100 万 token 价格 | Claude Sonnet 5.5 | Claude Opus 5.5 |
|---|---|---|
| 缓存读取 | $0.20 | $0.20 |
| 缓存写入 | $2.50 | $5 |
| 输入 token | $2 | $4 |
| 输出 token | $10 | $20 |
效率提升
- 速度: 输出生成速度比 Sonnet 5 快 30% 以上。
- 任务成本: 由于 token 效率提升,每项任务成本比 Sonnet 5 降低高达 30%。
- 努力等级: 用户可调整努力等级(低、中、高、X高、最大),在速度和成本之间权衡质量。中等为 Claude 应用的默认设置。
安全性、对齐性与防护措施
Sonnet 5.5 引入了先进的防护机制,以匹配其增强的能力,尤其是在网络安全领域。
- 网络安全: 由于能力与 Opus 5.5 相当,Sonnet 5.5 是首个发布时即配备网络安全防护的 Sonnet 模型。高风险请求将回退至 Sonnet 5。
- 蒸馏防护: 为防止通过工业级攻击提取模型能力,Sonnet 5.5 包含安全分类器,防止推理提取,并扩展了“保留思维”机制。
- 对齐性: 自动化行为审计显示,Sonnet 5.5 在诚实性、抗滥用性及对齐性方面与 Sonnet 5 相当或更优。
社区见解与不同观点
尽管官方基准测试表现强劲,但 Hacker News 的社区反馈揭示了若干实际关切与观察:
- 价值主张 vs. Opus: 多位用户质疑 Sonnet 5.5 在高努力等级下的实用性,指出 Opus 5.5 通常以相似或更低的成本提供更高的准确性。
- 思考 token 限制: 部分用户报告称,在“最大”努力等级下,模型可能耗尽其 128,000 token 的思考 token 限制,却仍未生成最终响应。
- 防护机制摩擦: 参与网络安全验证计划的用户报告称,防护机制可能过于激进,将授权的赏金工作误判为
Cyber违规。 - 性能退化: 部分用户报告在特定小众领域出现性能退化,例如在冷门编程语言方面,Sonnet 5.5 比 Sonnet 5 更不愿意坚持尝试。
- 竞争格局: 评论者指出,尽管 Sonnet 5.5 相比 Sonnet 5 是巨大飞跃,但其价格仍显著高于 DeepSeek 或 OpenAI 的 Luna 等竞争模型。
"在 Epic 的早期测试中,Claude Sonnet 5.5 达到了你对更高级别模型所期望的质量标准……新模型成功处理了数万行游戏系统架构代码,保持响应迅速,能处理数小时的任务,并且在更少的指令引导下完成任务。" — Daniel Vogel, COO, Epic Games
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch