Artificial Analysis Intelligence Index v4.2 发布分析

新评估提高了现实、私密测试的标准

AA‑BriefcaseSurge’s GDP.pdf 是 Index v4.2 中的核心新增项。AA‑Briefcase 由行业专家构建,使用私有留存测试集、基于评分标准的评分以及成对评分法,通过评估多周、智能体化的知识工作项目来衡量任务成功率、分析质量和演示质量。由 Surge AI 创建的 GDP.pdf 要求模型合成 4,592 页 PDF(文本、表格、图表、脚注)中的证据并满足 1,275 个原子标准;其核心指标是 All‑pass Rate(全通过率),只有当所有标准都得到满足时,任务才会被计为正确。

私有留存权重翻倍以遏制刷榜

在整体 Index 权重中,私有留存测试数据的比例已从 v4.1 中的 20% 增加到 v4.2 中的 40%。留存集现在包括 AA‑Briefcase、AA‑Omniscience 以及 CritPt 的解决方案。这一变化旨在减少模型开发人员对公开基准测试进行过拟合的能力,并使 Index 更能反映真实世界的性能。团队表示,私有权重将会在即将到来的 v5 版本中进一步增加。

评分基础设施升级提升了分数稳定性

版本 v4.2 在 AA‑LCR v1.1 中引入了新的评分系统提示词,修复了答案解析中的歧义,并重新锚定了 GDPval‑AA v2 和 AA‑Briefcase 的 Elo 刻度。SciCode 的沙盒环境已得到强化,使得运行缓慢但正确的代码不再被记录为失败。这些升级旨在随着新模型的加入,使分数更加准确且波动更小。

排行榜亮点:Claude Fable 5.1 和 GPT‑6 Astra 占据主导地位

  • Anthropic 的 Claude Fable 5.1 在整体 Index 中位居榜首。
  • OpenAI 的 GPT‑6 Astra 位列总榜第二,并在 output‑token 效率 前沿领域处于领先地位,与大多数竞争对手相比,其单位智能获取的 token 成本显著降低。
  • Meta、SpaceXAI、Moonshot/Kimi、Z.AI 和 Google 构成了前六名。

任务成本 Pareto 前沿

Anthropic、OpenAI、Meta 和 Z.AI 这四个实验室在更新后的任务成本 Pareto 前沿中占据一席之地,表明它们以最低的计算成本提供了最高的智能分数。

Token 效率前沿

GPT‑6 Astra 是 Index 中得分在 25 分以上的模型里 token 效率最高的模型,Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash‑Lite 构成了曲线的两端。

详细基准测试性能表现

  • AA‑Briefcase: Claude Fable 5.1 和 Opus 5 领先,随后是 GPT‑6 Astra 和 Muse Spark 1.3。GPT‑6 Astra 相比 GPT‑5.6 Sol 获得了约 85 Elo 分的提升。
  • GDP.pdf: OpenAI 的 GPT‑6 Astra 实现了 33.2% 的 All‑pass Rate,领先于 GPT‑5.6 Sol (28.2%) 和 Claude Fable 5.1 (26.2%)。

Hacker News 社区反应

  • 对私有留存测试的正面看法: @jascha_eng 指出,衡量知识可靠性并惩罚幻觉的 Omniscience 指标与真实世界的实用性强相关。他们强调 Fable 在该指标上优于 Opus 5,这与感知到的模型强度一致。
  • 对事后调整的怀疑: @redox99 认为该指数的调整是为了使 Astra 的分数符合预期,称这种变化“不科学”。
  • 对基准测试相关性的批评: @throwaway13337 认为新基准测试集“没用”,并质疑将 Gemini 3.8 等模型纳入其中。
  • 对 token 效率声称的赞赏: @jl 强调了 Astra 在 output-token 前沿的领先地位,指出其在展示的模型中拥有第二高的总分和第三低的 token 使用量。
  • 对更广泛基准测试覆盖范围的呼吁吁: @stared 和 @6thbit 询问为什么没有包含 ARC‑AGI‑3,并建议其加入后会改变排名。
  • 对权重变化担忧的 Concerns: @sanxiyn 和 @dgacmu 批评了 SciCode 的权重增加,将其称为“损坏的基准测试”,并主张使用更新的版本(例如 Terminal‑Bench 4.0)来更好地区分模型。

Artificial Analysis Index 的下一步计划?

团队确认 v4.2 是一个过渡版本,旨在加速即将到来的 v5 路线图。他们计划在正式发布 v5 之前进行额外的增量发布,届时将进一步增加私有测试权重,并引入更多复杂的真实世界任务。


欲了解完整的评估方法论和详细的逐模型分析,请访问 Artificial Analysis 网站。

Sources

相关