Hugging Face 社区评估与 Every Eval Ever (EEE) 集成
Hugging Face 社区评估与 Every Eval Ever (EEE) 集成
社区评估与 Every Eval Ever (EEE) 的集成
Hugging Face 已实现 Hugging Face Community Evals 与 Every Eval Ever (EEE) 之间的互操作性,允许评估结果在两个平台之间交叉发布和解释。此集成将开源模型和排行榜链接到统一、标准化的元数据存储,解决了 AI 评估报告碎片化的问题。
解决评估报告的空白
AI 评估结果目前分散在论文、博客文章和排行榜中,常常使用不一致的格式。这种缺乏标准化导致同一模型在同一基准上可能因评估者和使用的设置不同而报告出不同的分数。例如,LLaMA 65B 的 MMLU 分数既有 63.7 也有 48.8 的报告。
为了解决此问题,Every Eval Ever (EEE) 项目——由 EvalEval Coalition 于 2026 年 2 月启动——提供了一个统一的 JSON 架构用于评估结果。该架构记录关键元数据,包括:
- 评估者的身份
- 使用的模型
- 访问方式
- 生成设置
- 指标的定义
- 可选的伴随 JSONL 文件,用于每个样本的输出
截至 2026 年 6 月,Hugging Face 上的 EEE 数据存储约包含 229,000 条评估结果,覆盖 22,000 多个模型和 2,200 个基准,来源于 31 种不同的报告格式。
社区评估与 EEE 的协同工作方式
社区评估和 EEE 在模型评估生态系统中扮演互补角色:Hugging Face 提供用户发现模型的可见性层,而 EEE 提供包含完整技术记录的可解释性层。
Hugging Face 社区评估
社区评估通过两种机制在 Hub 上去中心化基准报告:
- Benchmark Registration: 基准在数据集仓库中以
eval.yaml文件形式存在,该文件会生成该基准在整个 Hub 上所有报告分数的排行榜。 - Model Score Reporting: 分数以 YAML 文件形式存储在模型仓库的
.eval_results/*.yaml中。这些分数会显示在模型卡片上,并输入到基准排行榜中。结果可以由模型作者、社区通过 pull requests,或独立验证者提交。
集成层
当结果同时发送到两个平台时,分数会出现在 Hugging Face 模型页面和基准排行榜上,但会附带一个来源徽章。该徽章直接链接到完整的 EEE JSON 记录,提供生成配置、harness 版本以及可复现性说明的访问。
技术实现与转换工具
为简化流程,Hugging Face 引入了一个转换器,将 EEE 记录转换为社区评估所需的 YAML 格式。
映射与支持的基准
转换器将特定的 EEE 字段映射到社区评估的 YAML 字段:
source_data.hf_repo$\rightarrow$dataset.idevaluation_name$\rightarrow$task_idscore_details.score$\rightarrow$valueevaluation_timestamp$\rightarrow$date
该工具目前支持四个官方基准:MMLU-Pro、GPQA、HLE 和 GSM8K。
工作流与验证
转换器不仅仅是重新组织数据;在推送更改之前,它会执行一系列审计:
- Data Retrieval: 下载指定的 EEE 数据存储集合并验证对象哈希。
- Audit: 读取模型主分支以及打开的 PR 中已有的
.eval_resultsYAML,以检查是否已有分数。 - Conflict Detection: 结果会被标记为
already_present、score_conflict(如果存在不同的分数)或missing_hf_model(如果仓库在 Hub 上无法解析)。有效条目标记为ready。 - Human Approval: 数据不会自动推送。工具会生成本地 YAML 预览和审查文件。只有在用户明确输入
OPEN PRS并提供提交信息后才会打开 PR。
入门指南
研究人员和评估者可以通过向 EEE 数据存储提交完整记录来贡献。要自动化向 Hugging Face 的提交,可使用 every_eval_ever GitHub 仓库中提供的社区评估转换工具,执行以下命令:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main