EvalEval 和 UK AISI 发布前沿大模型基准测试的公开评估卡片
TL;DR
EvalEval 和英国人工智能安全研究所(AISI)已发布五个高关注度基准测试(HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0)的公开验证评估卡片,涵盖六种前沿大模型,提供了可复现评估所需的完整配置、计算资源和协议细节。
为什么可复现的评估报告至关重要
可复现性至关重要,因为评估结果越来越多地成为模型性能与安全性的主要证据。当前的报告格式和平台分散,常常遗漏关键细节,如推理计算资源、评估协议和数据划分,导致重新运行实验成本过高。EvalEval 通过两个核心成果填补这一空白:
- Every Eval Ever (EEE) 模式 – 一种共享的、机器可读的基准元数据、模型元数据和运行时参数规范。
- 评估卡片 – 一个开放获取的门户,存储符合 EEE 标准的记录,将评分与精确的实验设置关联起来。
结合 AISI 在高效且统计严谨的评估方面的研究(如 OptStop、HiBayES),该合作旨在诊断报告中的缺口,并提供一个标准化的基础设施,以实现透明的评估。
AISI 分享的内容
AISI 已上传其近期论文《How Inference Compute Shapes Frontier LLM Evaluation》(arXiv:2606.17930)中列出的五个基准测试的评估卡片。每张卡片包含:
- 每个基准测试的已验证分数。
- 完整上下文,包括模型版本(Claude Opus 4, 4.5, 4.6;GPT-5, 5.2, 5.4)、推理时计算预算、令牌限制和评估协议。
- 配置细节,如提示模板、采样设置以及任何 oracle 反馈机制。
此次发布还包含两项辅助的网络安全评估(Cyber CTFs 和 The Last Ones),它们使用了部分重叠的模型集。通过公开这些细节,研究人员可以:
- 分析计算资源或协议变化对性能的影响(例如 Humanity’s Last Exam 的令牌效率曲线)。
- 比较看似数值相似但实验条件不同的研究结果。
- 将卡片用作元研究和政策分析的已验证参考点。
Humanity’s Last Exam 的表现随评估协议和推理计算而变化。每条曲线显示在给定令牌数量内成功解决的尝试任务累计占比,基于每项任务的最早成功观测值。
社区如何参与
EvalEval 联盟邀请三类群体帮助扩展生态系统:
- 模型开发者 – 通过 Get Verified 流程提交其模型的已验证评估卡片。
- 基准测试开发者 – 使用开源的 EEE 模式编码新基准测试并运行数据(提供 GitHub 链接)。
- 评估、治理和政策领域的研究人员 – 探索公共卡片仓库,评估报告质量,开展元分析,或为监管框架提供依据。
关于 EvalEval 联盟
EvalEval 联盟是一个专注于构建稳健、科学基础的 AI 评估基础设施的研究社区。其旗舰项目包括:
- Every Eval Ever – 一个通用模式和公开仓库,用于存储评估结果。
- 评估卡片 – 一个界面,将基准元数据、运行时数据和模型元数据聚合为可解释、可比较的记录。
这些工具使得能够检测到相同分数是否源于实质不同的实验条件,从而提升评估驱动决策的可靠性。
关于英国AI安全研究所(AISI)
AISI 是英国政府研究机构,隶属于科学、创新与技术部。其使命是为政府提供关于先进人工智能风险的科学洞察。AISI 的工作包括:
- OptStop – 通过提前终止无前景的运行来降低评估成本的方法。
- HiBayES – 使用分层贝叶斯建模实现统计严谨的大模型评估。
- 在基准测试中标准化转录分析和能力提取。
进一步阅读
- How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)
- HiBayES: 通过分层贝叶斯建模改进大模型评估 (AISI 博客 & arXiv:2505.05602)
- OptStop 论文 (arXiv:2608.14425)
- Every Eval Ever 项目页面
- 评估卡片门户