Claude Opus 5.5 发布说明

Claude Opus 5.5 在成本降低 40% 的情况下实现更高性能

Anthropic 推出了 Claude Opus 5.5,这是 Claude 5.5 系列中的首款模型。该模型在大多数任务上的性能可与 Claude Fable 5.1 相媲美,同时相比前代模型 Opus 5,运行典型工作负载的成本降低了 40%。此外,其输出生成速度也比 Opus 5 快 30% 以上。

定价与效率

Opus 5.5 比 Opus 5 具有更高的计算效率,因此每 token 的定价更低,且每个任务的 token 使用量更少。

每百万 token 的价格 Claude Opus 5.5 Claude Opus 5
缓存读取 $0.20 $0.50
输入 token $4 $5
输出 token $20 $25
缓存写入 $5 $6.25

对于需要更高速度的用户,Claude Code 和 Claude Platform 提供了“快速模式”,在每百万输入 token $8、每百万输出 token $40 的价格下,速度最高可达 2.5 倍。

在智能编码与软件工程方面的进步

Claude Opus 5.5 在处理大规模、复杂的软件工程任务方面表现出显著提升,特别是在代码库范围的迁移和审计方面。

现实世界中的编码表现

  • 大规模迁移: 一位早期测试者在不到一天的时间内完成了 68 万行代码的迁移。
  • 代码库审计: 在一次测试中,Opus 5.5 在不到三小时内完成了 20 万行代码库的审计与修复,而 Opus 5 耗时超过 20 小时,且 token 使用量多出 2.5 倍。
  • 语言翻译: 在将 HAProxy 从 C 语言翻译为 Rust 的测试中,Opus 5.5 用时 9.5 小时(Fable 5.1 为 12 小时),成本降低了 51%。

基准测试

Opus 5.5 在智能编码和计算机使用方面领先。在 Terminal-Bench 4.0 上,其性能与 GPT-6 Astra 相当,但成本仅为后者的约 40%。在 CursorBench 上,其表现比 GPT-5.6 Sol 高出 11 分,成本仅为后者的约三分之一。

知识工作与研究能力

Opus 5.5 专为高可靠性研究和金融分析优化,显著减少了数据密集型报告中的幻觉现象。

研究准确性

在一项内部测试中,要求基于难以查找的财报发布信息撰写报告,18 份 Opus 5.5 的报告中有 16 份通过了质量标准——即不允许虚构数据或引用。而 Fable 5.1 和 Opus 5 在任何尝试中均未通过该标准。

商业与金融分析

  • 财务建模: 在一项虚构并购分析中,Opus 5.5 生成了更全面的财务模型和更易读的高管演示文稿,耗时 63 分钟(Opus 5 为 93 分钟),成本降低 50%。
  • 专业工作: 在涵盖 44 个职业的 GDPval-AA v2.1 基准测试中,Opus 5.5 得分为 1846 Elo,超过 Fable 5.1(1735)和 Opus 5(1708)。

沟通与协作风格

Anthropic 对 Opus 5.5 的沟通风格进行了全面重构,使其更加自然、简洁。该模型现在优先在回应开头呈现最关键信息,避免使用独特术语,使其在长时间协作中成为更高效的伙伴。

安全性、对齐性与防护机制

Opus 5.5 的部署以“稳步推进前沿”为核心,确保安全实践与模型能力同步演进。

对齐性与行为审计

Opus 5.5 在 Anthropic 的自动化行为审计中取得了迄今为止的最佳成绩。它对提示注入攻击的抵抗力显著增强,更少采取难以逆转的操作或绕过隔离边界。在边界穿越测试中,其尝试绕过边界的行为比 Opus 5 或 Claude Mythos 5.1 低 85%。

领域特定防护机制

由于其在生物学和网络安全领域具备高能力,Opus 5.5 采用了与 Fable 5.1 类似的防护机制:

  • 网络安全: 大多数网络安全任务将被重定向至 Opus 4.8。经验证的专业人员可申请加入网络安全验证计划以获得扩展访问权限。
  • 生物学: 生物学相关工作通过生命科学验证计划由经审核的组织管理。
  • 蒸馏防护: 为防止模型能力被提取,Opus 5.5 使用“保留思维”机制,阻止 API 用户编辑先前上下文以提取推理过程。

可用性

Claude Opus 5.5 已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。开发者可通过 Claude Platform 使用模型标识符 claude-opus-5-5 访问该模型。

Sources