Hugging Face 社群評估與 Every Eval Ever (EEE) 整合
Hugging Face 社群評估與 Every Eval Ever (EEE) 整合
社群評估與 Every Eval Ever (EEE) 的整合
Hugging Face 已啟用 Hugging Face 社群評估與 Every Eval Ever (EEE) 之間的互通性,允許評估結果在兩個平台之間交叉發布與解讀。此整合將開放模型與排行榜連結至統一、標準化的中繼資料庫,以解決 AI 評估報告的碎片化問題。
解決評估報告的缺口
目前 AI 評估結果散落於論文、部落格文章與排行榜中,且常使用不一致的格式。缺乏標準化導致同一模型在同一基準測試上,根據評估者與使用的設定不同,可能報告出不同的分數。例如,LLaMA 65B 的 MMLU 分數同時被報告為 63.7 與 48.8。
為了解決此問題,Every Eval Ever (EEE) 計畫——由 EvalEval 聯盟於 2026 年 2 月發起——提供單一的 JSON 架構來記錄評估結果。此架構記錄關鍵的中繼資料,包括:
- 評估者的身份
- 使用的模型
- 存取方式
- 生成設定
- 指標的定義
- 可選的伴隨 JSONL 檔案,用於每個樣本的輸出
截至 2026 年 6 月,Hugging Face 上的 EEE 資料庫約包含 229,000 筆評估結果,涵蓋超過 22,000 個模型與 2,200 個基準測試,來源於 31 種不同的報告格式。
社群評估與 EEE 如何協同運作
社群評估與 EEE 在模型評估生態系統中扮演互補的角色:Hugging Face 提供使用者發現模型的可見性層,而 EEE 提供包含完整技術紀錄的可解釋性層。
Hugging Face 社群評估
社群評估透過兩種機制去中心化 Hub 上的基準測試報告:
- 基準註冊: 基準測試存在於資料集倉庫中,並附有
eval.yaml檔案,該檔案會產生該基準測試在整個 Hub 上所有報告分數的排行榜。 - 模型分數報告: 分數以 YAML 檔案儲存在模型倉庫內的
.eval_results/*.yaml中。這些分數會顯示於模型卡片,並匯入基準測試排行榜。結果可由模型作者、社群透過 pull request,或獨立驗證者提交。
整合層
當結果同時送至兩個平台時,分數會顯示在 Hugging Face 模型頁面與基準測試排行榜上,但會附帶來源徽章。此徽章直接連結回完整的 EEE JSON 記錄,提供生成設定、harness 版本與可重現性說明的存取。
技術實作與轉換工具
為了簡化流程,Hugging Face 推出了將 EEE 記錄轉換為社群評估所需 YAML 格式的轉換器。
映射與支援的基準測試
轉換器將特定的 EEE 欄位映射至社群評估的 YAML 欄位:
source_data.hf_repo$\rightarrow$dataset.idevaluation_name$\rightarrow$task_idscore_details.score$\rightarrow$valueevaluation_timestamp$\rightarrow$date
此工具目前支援四個官方基準測試:MMLU-Pro、GPQA、HLE 與 GSM8K。
工作流程與驗證
轉換器不僅僅是重新整理資料;它在推送變更前會執行一系列稽核:
- 資料取得: 下載指定的 EEE 資料庫集合,並驗證物件雜湊值。
- 稽核: 讀取模型主分支上現有的
.eval_resultsYAML 檔案以及開放的 PR,以檢查是否已有分數。 - 衝突偵測: 結果會被標記為
already_present、score_conflict(若存在不同分數)或missing_hf_model(若倉庫在 Hub 上無法解析)。有效的條目會標記為ready。 - 人工批准: 不會自動推送資料。工具會產生本地 YAML 預覽與審查檔案。只有在使用者明確輸入
OPEN PRS並提供提交訊息後,才會開啟 PR。
入門指南
研究人員與評估者可透過提交完整記錄至 EEE 資料庫來貢獻。若要自動化提交至 Hugging Face,可使用 every_eval_ever GitHub 倉庫中提供的社群評估轉換工具,指令如下:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main