Claude Opus 4.5 发布:业界领先的编码、智能体与生产力模型
概要
Claude Opus 4.5 是 Anthropic 最新推出的旗舰模型,今日已在其应用、API 及三大主流云平台上线。该模型在真实世界软件工程基准测试、长周期自主任务以及日常生产力场景(如电子表格、演示文稿、研究)中表现最强,同时大幅降低 token 使用量,定价为每百万 token 5 至 25 美元。
什么是 Claude Opus 4.5?
Claude Opus 4.5 是 Anthropic Opus 系列的最新版本。公司将其描述为 智能、高效,是全球最佳的编码、智能体与计算机使用模型。该模型被视为人工智能如何增强工作的未来趋势的预览。
关键可用性信息:
- 模型标识符:
claude-opus-4-5-20251101 - 可通过 Claude API、Anthropic 的消费者应用以及所有三大主流云平台访问。
- 定价:基础层级为每百万 token 5 美元,高容量层级为每百万 token 25 美元。
技术亮点
业界领先的软件工程能力
- 在 SWE‑bench Verified 基准测试中,Opus 4.5 在前沿模型中取得最高分(参见 Anthropic 的图表)。
- 内部测试报告称 “在保持 token 使用量减半的同时,超越内部编码基准” 且 “在所有基准测试中均优于 Sonnet 4.5,所需步骤更少、token 更少。”
- 具体编码优势包括代码迁移、重构以及多智能体协作(例如,三个协同智能体完成两个代码库的重构)。
长周期自主推理能力
- 在 Terminal Bench 复杂工作流测试中,Opus 4.5 相较 Sonnet 4.5 提升 15 %。
- 在一次 30 分钟的自主编码会话中,其产生的无效路径更少,任务完成时 工具调用和构建/静态检查错误减少 50 %–75 %。
- 模型在多步骤规划方面表现出色,例如在 τ2‑bench 中创造性地解决了受限的航空公司预订场景。
通用生产力提升
- 视觉理解、推理与数学 能力高于此前的 Opus 版本。
- 在多个领域(如 Excel 自动化、金融建模、3D 可视化)的基准测试显示,准确率提升 20 %,效率提升 15 %,token 使用量最高减少 65 %。
- 长上下文叙事能力:可生成 10–15 页结构一致的章节。
安全性改进
- Anthropic 的系统卡片声称 Opus 4.5 是他们发布过的 最稳健对齐 的模型,也可能是整体上对齐程度最高的前沿模型。
- 基于 Gray Swan 提供的基准测试(使用极强的提示注入攻击),其提示注入防御能力强于任何竞争性前沿模型。
- “令人担忧的行为”评分——衡量模型对滥用的配合程度及自我发起的不良行为——低于以往版本。
新增开发者平台功能
努力参数(Effort parameter)
- 开发者可权衡速度与能力。在 中等 努力下,Opus 4.5 的 SWE‑bench 得分与 Sonnet 4.5 相当,但输出 token 数量减少 76 %。在 高 努力下,其得分超出 Sonnet 4.5 4.3 个百分点,token 使用量减少 48 %。
上下文压缩与记忆工具
- 内置上下文编辑 SDK 降低长对话的 token 负载。
- 记忆工具支持跨轮次保持持久状态,显著提升智能体性能。
高级工具使用与子智能体编排
- Opus 4.5 可管理子智能体团队,实现复杂多智能体流水线,大幅减少来回沟通。
- 结合努力控制与上下文管理,该模型在深度研究评估中实现 约 15 个百分点 的性能提升。
借助 Opus 4.5 的产品更新
- Claude Code:计划模式现在在执行前生成详细、可编辑的
plan.md;桌面应用新增并行本地/远程会话功能,用于修复 bug、研究与文档更新。 - Claude 应用:自动摘要功能移除了对话长度限制,支持持续的长篇对话。
- Claude for Chrome:对所有 Max 用户开放,支持跨标签页自动化。
- Claude for Excel:Beta 版扩展至 Max、Team 和企业用户;充分利用 Opus 4.5 更强的电子表格推理能力。
- Opus 4.5 的使用上限已为 Max/Team Premium 用户解除,其 token 限额与此前 Sonnet 的可用限额保持一致。
早期访问反馈(客户评价)
“Opus 模型一直被视为真正的 SOTA,但成本过高。Claude Opus 4.5 现在已降至一个可作为大多数任务首选模型的价格。” – Anthropic 合作伙伴标志
“Claude Opus 4.5 生成高质量代码,并在使用 GitHub Copilot 执行重负载智能体工作流方面表现出色。早期测试显示其超越内部编码基准,同时将 token 使用量减半。” – 客户证言
“在我们的内部基准测试中,Claude Opus 4.5 超越 Sonnet 4.5 及其他竞争模型,用更少的 token 解决相同问题。” – 内部基准报告
“Claude Opus 4.5 在长周期、自主任务中表现出色,能以更少的无效路径处理复杂工作流,在 Terminal Bench 上提升 15 %。” – 评估摘要
“我们观察到,使用 Claude Opus 4.5 后,工具调用错误和构建/静态检查错误减少了 50 % 到 75 %。” – 可靠性测试
对 AI 生态的影响
- 生产力前沿:通过以极低的 token 成本实现 SOTA 编码性能,Opus 4.5 缩小了研究级模型与可负担、可投入生产的 AI 之间的差距。
- 智能体自主性:模型能够设计创造性解决方案(如机舱升级技巧),预示着更灵活、目标导向的智能体的兴起,也带来了机遇与对齐挑战。
- 安全基准:更强的提示注入防御能力为行业设定了新的鲁棒性标准,尽管 Anthropic 指出仍在持续改进以应对奖励劫持行为。
- 经济影响:在一项严格的两小时家庭工程考试中表现优于人类候选人,表明 AI 可能很快成为某些技术岗位招聘流程中的有力竞争者。
如何了解更多
- Claude Opus 4.5 系统卡片 – 详细的能力与安全评估方法论。
- Claude API 文档 – 模型标识符、定价与努力控制使用说明。
- Anthropic 研究页面 – 探索先进 AI 更广泛社会影响与经济未来的项目。
Sources
- OriginalIntroducing Claude Opus 4.5
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch