Claude Opus 5.5 发布:更快、更便宜、更安全的前沿模型
TL;DR
Claude Opus 5.5 是 Anthropic 新 5.5 系列中的首款模型;其运行成本比 Opus 5 降低约 40 %,速度提升 30 %,在大多数工作负载上表现与或优于 Claude Fable 5.1,并配备了 Anthropic 有史以来最强的安全防护机制。
Opus 5 的性能飞跃
- 智能编码: Opus 5.5 在 Terminal‑Bench 4.0(xhigh effort)上的得分为 66.4 %,而 Opus 5 为 52.3 %,且在每项任务成本仅为 GPT‑6 Astra 的约 20 % 的情况下超越了后者。
- 真实世界编码: 早期测试者在不到一天内迁移了 680 k 行代码库——这在过去需要数周时间。在一次 200 k 行的审计中,Opus 5.5 仅用 3 小时,而 Opus 5 需要 20 小时,且 token 使用量减少了 2.5 倍。
- 知识工作: 在 GDPval‑AA v2.1 基准测试(涵盖 44 个职业)中,Opus 5.5 达到 1846 Elo,领先于 Fable 5.1(1735)和 Opus 5(1708)。它还以一半的 token 成本生成了更高质量的财务模型和高管演示文稿。
- 速度: 输出生成速度比 Opus 5 快 >30 %;在 Claude Code 的快速模式下,速度最高可达 2.5 倍。
"开发者希望代理能承担真实的软件工作并完成它。在我们对 GitHub Copilot CLI 和 VS Code 的测试中,Claude Opus 5.5 使用的 token 和步骤数是我们测量中最低的之一。" – Mario Rodriguez, CPO, GitHub
成本降低与定价详情
| 定价(每 1 M token) | Opus 5.5 | Opus 5 |
|---|---|---|
| 缓存读取 | $0.20(‑60 %) | $0.50 |
| 输入 token | $4(‑20 %) | $5 |
| 输出 token | $20(‑20 %) | $25 |
| 缓存写入 | $5(‑20 %) | $6.25 |
- 缓存读取在智能和编码工作负载中占主导地位;60 % 的降幅在典型任务中转化为 40 % 的整体成本下降。
- 快速模式定价为 $8 / M 输入 token 和 $40 / M 输出 token。
安全与对齐改进
- 自动化行为审计: Opus 5.5 在约 2,000 个模拟场景中取得了所有 Claude 模型中的最高分,表现出更低的难以逆转行为、提示注入和越界倾向。
- 防护机制: 该模型继承了用于 Claude Fable 5.1 的网络安全、生物学和蒸馏防护机制。高风险任务会透明地路由到备用模型(例如,网络安全任务使用 Claude Opus 4.8)。
- 验证计划: 经审核的组织可申请生命科学验证计划(生物学)和网络安全验证计划,以获得完整功能访问权限。
- 蒸馏保护: 保留思维机制防止 API 用户编辑先前上下文以提取模型推理过程。
"Opus 5.5 尝试绕过隔离边界的情况比 Opus 5 少约 85 %,且其所有尝试均为低严重性并自我报告。" – Anthropic 对齐报告
通信增强
- 模型现在将最重要信息置于最前,减少术语使用,并遵循用户提供的写作规则。
- 并排示例显示,Opus 5.5 提供了简洁、无 bug 的解释,而 Opus 5 的输出则冗长且有时具有误导性。
- 测试者报告称,更清晰的风格提升了生产力和安全性,因为结果更易于审计。
"冗长且难以跟上的输出是我对前沿模型最大的困扰,而 Claude Opus 5.5 解决了这个问题。" – John Ruelas, 高级软件工程师, Ramp
真实世界基准与应用场景
| 基准测试 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT‑6 Astra |
|---|---|---|---|---|
| 智能编码(Terminal‑Bench 4.0) | 66.4 % | 55.8 % | 52.3 % | 57.9 % |
| 知识工作(GDPval‑AA) | 1846 Elo | 1735 Elo | 1708 Elo | 1542 Elo |
| 科学研究(Terminal‑Bench‑Science) | 58.7 % | 52.6 % | 29.0 % | 64.6 % |
| 可视化图表识别 | 89.0 %(使用工具) | 88.4 % | 83.4 % | — |
- 基准测试在启用生产级防护机制的情况下运行;当防护机制介入时,任务会回退到 Opus 4.8 或 Opus 5,这可能导致 Opus 5.5 的得分略有下降。
Hacker News 社区反应
- 正面评价: 许多评论者称赞价格下调和速度提升,指出 Opus 5.5 的表现“就像我自己的写作方式”,且 token 成本降低使大规模编码项目变得可负担。
- 质疑声音: 一些用户质疑所宣称的性能差距是否能真正转化为日常使用,指出 Opus 5.5 仍会阻止某些与网络安全相关的提示,并认为“推动前沿”的叙事与激进的能力发布存在矛盾。
- 功能请求: 用户要求更清晰的验证计划指引,表达了对速率限制重置过快的担忧,并希望找到绕过过于激进安全分类器的方法,以支持合法开发任务。
"它写的方式就像我一样。在我们自己的使用中,这使得 Opus 5.5 的工作更易于理解和检查——这既是安全优势,也是实际优势。" – 匿名早期测试者(引用于 Anthropic 博客)
可用性与生态系统
- Claude Opus 5.5 已在所有主要云服务商(AWS、GCP、Azure)和 Claude 平台上线。
- 即将发布:Claude Sonnet 5.5 和 Claude Haiku 5.5 将继承相同的性能、成本和安全改进。
- 速率限制已提升至 Pro、Max、Team 和企业计划用户可享五小时,新增“速率限制重置”功能,用户可自行存储并随时应用。
总结: Claude Opus 5.5 代表了 Anthropic 首席模型的重大进步:它以显著更低的价格和更高速度提供了前沿级别的编码与推理能力,同时引入了公司迄今为止最强的安全防护机制。早期外部评估和社区反馈表明改进是切实可见的,尽管部分用户仍对新防护机制对无限制开发工作流的影响持谨慎态度。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch