EvalEval 和 UK AISI 发布前沿大模型基准测试的公开评估卡片

TL;DR

EvalEval 和英国人工智能安全研究所(AISI)已发布五个高关注度基准测试(HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0)的公开验证评估卡片,涵盖六种前沿大模型,提供了可复现评估所需的完整配置、计算资源和协议细节。

为什么可复现的评估报告至关重要

可复现性至关重要,因为评估结果越来越多地成为模型性能与安全性的主要证据。当前的报告格式和平台分散,常常遗漏关键细节,如推理计算资源、评估协议和数据划分,导致重新运行实验成本过高。EvalEval 通过两个核心成果填补这一空白:

  • Every Eval Ever (EEE) 模式 – 一种共享的、机器可读的基准元数据、模型元数据和运行时参数规范。
  • 评估卡片 – 一个开放获取的门户,存储符合 EEE 标准的记录,将评分与精确的实验设置关联起来。

结合 AISI 在高效且统计严谨的评估方面的研究(如 OptStop、HiBayES),该合作旨在诊断报告中的缺口,并提供一个标准化的基础设施,以实现透明的评估。

AISI 分享的内容

AISI 已上传其近期论文《How Inference Compute Shapes Frontier LLM Evaluation》(arXiv:2606.17930)中列出的五个基准测试的评估卡片。每张卡片包含:

  • 每个基准测试的已验证分数。
  • 完整上下文,包括模型版本(Claude Opus 4, 4.5, 4.6;GPT-5, 5.2, 5.4)、推理时计算预算、令牌限制和评估协议。
  • 配置细节,如提示模板、采样设置以及任何 oracle 反馈机制。

此次发布还包含两项辅助的网络安全评估(Cyber CTFs 和 The Last Ones),它们使用了部分重叠的模型集。通过公开这些细节,研究人员可以:

  • 分析计算资源或协议变化对性能的影响(例如 Humanity’s Last Exam 的令牌效率曲线)。
  • 比较看似数值相似但实验条件不同的研究结果。
  • 将卡片用作元研究和政策分析的已验证参考点。

Humanity’s Last Exam 的表现随评估协议和推理计算而变化。每条曲线显示在给定令牌数量内成功解决的尝试任务累计占比,基于每项任务的最早成功观测值。

社区如何参与

EvalEval 联盟邀请三类群体帮助扩展生态系统:

  • 模型开发者 – 通过 Get Verified 流程提交其模型的已验证评估卡片。
  • 基准测试开发者 – 使用开源的 EEE 模式编码新基准测试并运行数据(提供 GitHub 链接)。
  • 评估、治理和政策领域的研究人员 – 探索公共卡片仓库,评估报告质量,开展元分析,或为监管框架提供依据。

关于 EvalEval 联盟

EvalEval 联盟是一个专注于构建稳健、科学基础的 AI 评估基础设施的研究社区。其旗舰项目包括:

  • Every Eval Ever – 一个通用模式和公开仓库,用于存储评估结果。
  • 评估卡片 – 一个界面,将基准元数据、运行时数据和模型元数据聚合为可解释、可比较的记录。

这些工具使得能够检测到相同分数是否源于实质不同的实验条件,从而提升评估驱动决策的可靠性。

关于英国AI安全研究所(AISI)

AISI 是英国政府研究机构,隶属于科学、创新与技术部。其使命是为政府提供关于先进人工智能风险的科学洞察。AISI 的工作包括:

  • OptStop – 通过提前终止无前景的运行来降低评估成本的方法。
  • HiBayES – 使用分层贝叶斯建模实现统计严谨的大模型评估。
  • 在基准测试中标准化转录分析和能力提取。

进一步阅读

  • How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)
  • HiBayES: 通过分层贝叶斯建模改进大模型评估 (AISI 博客 & arXiv:2505.05602)
  • OptStop 论文 (arXiv:2608.14425)
  • Every Eval Ever 项目页面
  • 评估卡片门户

Sources