Hugging Face 社群評估與 Every Eval Ever (EEE) 整合

社群評估與 Every Eval Ever (EEE) 的整合

Hugging Face 已啟用 Hugging Face 社群評估與 Every Eval Ever (EEE) 之間的互通性,允許評估結果在兩個平台之間交叉發布與解讀。此整合將開放模型與排行榜連結至統一、標準化的中繼資料庫,以解決 AI 評估報告的碎片化問題。

解決評估報告的缺口

目前 AI 評估結果散落於論文、部落格文章與排行榜中,且常使用不一致的格式。缺乏標準化導致同一模型在同一基準測試上,根據評估者與使用的設定不同,可能報告出不同的分數。例如,LLaMA 65B 的 MMLU 分數同時被報告為 63.7 與 48.8。

為了解決此問題,Every Eval Ever (EEE) 計畫——由 EvalEval 聯盟於 2026 年 2 月發起——提供單一的 JSON 架構來記錄評估結果。此架構記錄關鍵的中繼資料,包括:

  • 評估者的身份
  • 使用的模型
  • 存取方式
  • 生成設定
  • 指標的定義
  • 可選的伴隨 JSONL 檔案,用於每個樣本的輸出

截至 2026 年 6 月,Hugging Face 上的 EEE 資料庫約包含 229,000 筆評估結果,涵蓋超過 22,000 個模型與 2,200 個基準測試,來源於 31 種不同的報告格式。

社群評估與 EEE 如何協同運作

社群評估與 EEE 在模型評估生態系統中扮演互補的角色:Hugging Face 提供使用者發現模型的可見性層,而 EEE 提供包含完整技術紀錄的可解釋性層。

Hugging Face 社群評估

社群評估透過兩種機制去中心化 Hub 上的基準測試報告:

  1. 基準註冊: 基準測試存在於資料集倉庫中,並附有 eval.yaml 檔案,該檔案會產生該基準測試在整個 Hub 上所有報告分數的排行榜。
  2. 模型分數報告: 分數以 YAML 檔案儲存在模型倉庫內的 .eval_results/*.yaml 中。這些分數會顯示於模型卡片,並匯入基準測試排行榜。結果可由模型作者、社群透過 pull request,或獨立驗證者提交。

整合層

當結果同時送至兩個平台時,分數會顯示在 Hugging Face 模型頁面與基準測試排行榜上,但會附帶來源徽章。此徽章直接連結回完整的 EEE JSON 記錄,提供生成設定、harness 版本與可重現性說明的存取。

技術實作與轉換工具

為了簡化流程,Hugging Face 推出了將 EEE 記錄轉換為社群評估所需 YAML 格式的轉換器。

映射與支援的基準測試

轉換器將特定的 EEE 欄位映射至社群評估的 YAML 欄位:

  • source_data.hf_repo $\rightarrow$ dataset.id
  • evaluation_name $\rightarrow$ task_id
  • score_details.score $\rightarrow$ value
  • evaluation_timestamp $\rightarrow$ date

此工具目前支援四個官方基準測試:MMLU-Pro、GPQA、HLE 與 GSM8K

工作流程與驗證

轉換器不僅僅是重新整理資料;它在推送變更前會執行一系列稽核:

  1. 資料取得: 下載指定的 EEE 資料庫集合,並驗證物件雜湊值。
  2. 稽核: 讀取模型主分支上現有的 .eval_results YAML 檔案以及開放的 PR,以檢查是否已有分數。
  3. 衝突偵測: 結果會被標記為 already_presentscore_conflict(若存在不同分數)或 missing_hf_model(若倉庫在 Hub 上無法解析)。有效的條目會標記為 ready
  4. 人工批准: 不會自動推送資料。工具會產生本地 YAML 預覽與審查檔案。只有在使用者明確輸入 OPEN PRS 並提供提交訊息後,才會開啟 PR。

入門指南

研究人員與評估者可透過提交完整記錄至 EEE 資料庫來貢獻。若要自動化提交至 Hugging Face,可使用 every_eval_ever GitHub 倉庫中提供的社群評估轉換工具,指令如下:

uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch