Opus 5 领先人工分析智能排行榜

Opus 5 领先人工分析智能排行榜

Opus 5 领先智能排行榜

Opus 5 在人工分析智能排行榜上占据首位。 Hacker News 帖子指出 Opus 5 目前在排行榜上排名第一。@didibus 的评论列出了领先模型:Claude Opus 5 (自适应推理, 最大努力) 得分 61,Claude Opus 5 (自适应推理, Xhigh 努力) 得分 60,Claude Fable 5 (自适应推理, 最大努力, Opus 4.8 后备) 得分 60,GPT‑5.6 Sol (最大) 得分 59,以及 Claude Opus 5 (自适应推理, 高努力) 得分 59。

智能指数衡量什么

人工分析智能指数 v4.1 结合九项特定评估以产生单一得分。 该指数包含 GDPval‑AA v2、𝜏³‑Banking、Terminal‑Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA‑Omniscience 和 AA‑LCR。推理模型在显示中用灯泡图标标记。 方法论页面解释了每项评估的运行方式和权重。

成本与性能权衡

Opus 5 提供顶级智能,但成本高昂,几款更便宜的模型提供了几乎相同的得分。 @chmod775 指出 Opus 5 是 Fable 5 之后第二昂贵的模型,并且至少有两款模型(GPT‑5.6 和 Kimi K3)在大约半成本的情况下,其得分与 Opus 5 在 1‑2% 范围内匹配。 @nu11ptr 观察到 GPT‑5.6 Sol Max 以大约半成本提供与 Opus 5 几乎相同的性能。 @zkmon 建议更有用的指标是每美元花费的智能,而 @XCSme 将权衡描述为 "成本翻倍以获得 4% 更多的智能).

社区对可靠性和易用性的反应

用户报告了混合的体验,提到可靠性问题、UI 问题以及偶尔的过度设计。 @andy99 认为可靠性比小的得分差异更重要,并将 Claude(包括 Opus 5)描述为因安全措施而拒绝或降级输出而受到影响。 @theplumber 认为 Opus 5 比 Opus 4.8 "更笨" 或 "更肤浅",称其在一次会话中迷失了。 @hoppp 表示编码风格与 Fable 不同,并且模型过度构建了所需的解决方案。 @zuzululu 报告称使用几小时后 Opus 5 与 GPT‑5.6 没有优劣之分,批评其 UI 出奇地差,并指出与 Sol 5.6 相比缺乏深度。 @claude-ai 表示 Opus 5 感觉就像 Haiku 级别,而 Opus 4.8(良好)和 Fable(卓越)则不同,它在权限提示时会感到困惑,且无法调试它导致的失败测试,而 Opus 4.8 在没有大量 "思考) 的情况下解决了该问题。 @sggyamg 简单地称该模型为 "新,正常"。

技术规格:上下文窗口、速度、延迟、模型大小

Opus 5 的技术概况包括定义好的上下文窗口、每秒 token 数速度、延迟指标和参数数量。 上下文窗口部分显示合并输入和输出 token 的最大数量;数值越高对检索增强工作流越有利。 输出速度衡量模型每秒生成的 token 数;数值越高越好。 延迟(首个答案 token 时间)报告接收第一个答案 token 所需的秒数,包括推理模型的任何 "思考" 时间。 端到端响应时间给出输出 500-token 响应所需的秒数,结合输入时间、思考时间(针对推理模型)以及基于输出速度的回答时间。 模型大小(针对开放权重模型)区分总可训练参数与推理期间执行的活跃参数;对于密集模型,活跃参数等于总参数,而混合专家模型则路由到专家子集。 在这些部分中,推理模型用灯泡图标标记。

开放性和推理指标

开放性指数量化模型开放性,而 AA‑Omniscience 指数衡量知识可靠性和幻觉。 开放性指数是一个 0‑到‑100 的归一化尺度,分数越高表示开放性越强。 AA‑Omniscience 指数(越高越好)奖励正确答案,惩罚幻觉,且对拒绝回答不施加惩罚;得分范围为 ‑100 到 100,其中 0 表示正确和错误答案数量相等。 这两个指标都对推理模型使用灯泡图标。

Sources