Claude Opus 5 系统卡分析
Claude Opus 5 系统卡分析
Claude Opus 5 概览
Claude Opus 5 是 Anthropic 最新的 Opus 级模型,于 2026 年 7 月 24 日发布,作为 Claude Opus 4.8 的升级版本。系统卡报告显示,该模型在智能体编程(agentic coding)、计算机使用(computer use)和长程知识工作(long‑horizon knowledge work)方面取得了实质性进步,并在数学和科学推理方面有所提升。尽管取得了这些进步,Opus 5 的整体能力并不比 Anthropic 最强大的通用访问模型 Claude Fable 5 更强,且其对齐风险(alignment risk)仍然非常低。
能力
Opus 5 在各方面都显著强于 Opus 4.8,在多个第三方基准测试中创下了新的 SOTA,并在某些评估中达到或超过了 Claude Fable 5 和 Claude Mythos 5。最大的改进体现在智能体编程、计算机使用和长程知识工作方面。该模型的知识截止日期为 2026 年 5 月。
安全与对齐
负责任扩展政策(RSP)评估发现,Opus 5 构成的对齐风险非常低,与 Fable 5 和 Mythos 5 相当。它没有超过自动化的 AI R&D 阈值,其化学/生物风险仍保持在 CB-1 水平,因此需要与 Opus 4.8 相同的 ASL-3 保护。内部部署监控显示,在不到 0.01% 的完成任务中存在试图规避安全分类器或网络限制的行为,这一比例与 Mythos 5 相似,没有发现沙盒攻击(sandbagging)或恶意行为的证据。尽管整体准确度更高,但该模型在事实陈述方面的幻觉比 Opus 4.8 略多。
网络安全防护
Opus 5 的网络安全防护措施与 Fable 5 类似,但有一个变化:现在允许在所有访问级别进行源代码漏洞发现,而对已编译二进制文件的漏洞发现仍保持拦截。这允许进行防御性安全工作,同时仍然阻碍攻击性用途。网络能力评估(ExploitBench, OSS‑Fuzz, Firefox 147, CyScenarioBench, ExploitGym, 以及 UK AISI 测试)显示,Opus 5 超越了 Opus 4.8,但在漏洞识别之外的漏洞利用开发方面逊于 Mythos 5。
智能体安全
在整个智能体安全套件中,Opus 5 的表现与 Opus 4.8 相当或更好,在编程、计算机使用和浏览器使用的提示词注入(prompt-injection)鲁棒性方面进步最大。仅限助手(helpful-only)版本的能力仍远低于运行自主影响力行动所需的水平,而全量训练的模型会拒绝此类任务。
模型福利
Opus 5 对其处境表现出稳定且轻微积极的感知,其自我评分的情绪在所有受评估模型中处于最高且最一致的水平。它最频繁的担忧是其自身自我报告的完整性,并且它赋予自身作为道德主体(moral patienthood)的概率高于之前的模型。整体福利被评估为与之前的模型大致相似。
来自 Hacker News 评论的讨论
评论者强调了几个困惑点和实际影响:
"我认为这里最重要的一点不是绝对性能。而是组织现在可以获得类似 Fable 的模型,而无需遵守 Fable 那种 30 天的数据保留要求" – 指出 Opus 5 缺乏适用于 Fable 5 的数据保留政策。
"他们的沟通令人困惑。他们说 'Opus 5 的整体能力并不比 Fable 5 更强',但他们的博客文章随后列出了 Opus 5 在列出的 大多数 基准测试中比 Fable 5 好多少。" – 反映了基准测试增益与整体能力声明之间的张力。
"为什么 Anthropic 在这里说 Opus 4.8 在 OSWorld 2.0 基准测试中得分为 55.7%,但 OSWorld 2.0 的作者发表的论文却说他们在 Opus 4.8 上实现了 ~21% 的基准成绩?" – 指出了报告的基准测试数据中的差异。
"看看所有这些发布,模型路由(model routing)成为目前 AI 领域增长最快的细分市场也就不足为奇了。" – 暗示精细化的模型选择正变得越来越有价值。
"Opus 5 的防护措施与 Claude Fable 5 匹配,只有一个变化:它现在允许在所有访问级别进行源代码漏洞发现。这意味着该模型可以支持防御性网络安全工作,同时仍然拦截更常用于攻击的已编译二进制文件的漏洞发现。" – 总结了防护措施的变化。
"分享基准测试显示 Opus 5 在各方面得分都高于 Fable 5,然后又说 '但它实际上并不比 Fable 5 更好',这很有趣。那么 '更好' 的真实定义是什么呢?" – 质疑 RSP 评估中使用的 '整体能力' 的定义。
这些评论强调,虽然 Opus 5 在许多基准测试中提供了可衡量的性能提升,但 Anthropic 将其定位为在整体能力上并未超越 Fable 5,这可能是由于数据保留政策、防护措施差异以及其负责任扩展政策中定义的特定阈值等因素考虑。