Hugging Face 社群評估與 Every Eval Ever (EEE) 整合
社群評估與 Every Eval Ever (EEE) 的整合
Hugging Face 已啟用 Hugging Face 社群評估與 Every Eval Ever (EEE) 之間的互通性,允許評估結果在兩個平台之間交叉發布與解讀。此整合將開放模型與排行榜連結至統一、標準化的中繼資料庫,以解決 AI 評估報告的碎片化問題。
解決評估報告的缺口
目前 AI 評估結果散落於論文、部落格文章與排行榜中,且常使用不一致的格式。缺乏標準化導致同一模型在同一基準測試上,根據評估者與使用的設定不同,可能報告出不同的分數。例如,LLaMA 65B 的 MMLU 分數同時被報告為 63.7 與 48.8。
為了解決此問題,Every Eval Ever (EEE) 計畫——由 EvalEval 聯盟於 2026 年 2 月發起——提供單一的 JSON 架構來記錄評估結果。此架構記錄關鍵的中繼資料,包括:
- 評估者的身份
- 使用的模型
- 存取方式
- 生成設定
- 指標的定義
- 可選的伴隨 JSONL 檔案,用於每個樣本的輸出
截至 2026 年 6 月,Hugging Face 上的 EEE 資料庫約包含 229,000 筆評估結果,涵蓋超過 22,000 個模型與 2,200 個基準測試,來源於 31 種不同的報告格式。
社群評估與 EEE 如何協同運作
社群評估與 EEE 在模型評估生態系統中扮演互補的角色:Hugging Face 提供使用者發現模型的可見性層,而 EEE 提供包含完整技術紀錄的可解釋性層。
Hugging Face 社群評估
社群評估透過兩種機制去中心化 Hub 上的基準測試報告:
- 基準註冊: 基準測試存在於資料集倉庫中,並附有
eval.yaml檔案,該檔案會產生該基準測試在整個 Hub 上所有報告分數的排行榜。 - 模型分數報告: 分數以 YAML 檔案儲存在模型倉庫內的
.eval_results/*.yaml中。這些分數會顯示於模型卡片,並匯入基準測試排行榜。結果可由模型作者、社群透過 pull request,或獨立驗證者提交。
整合層
當結果同時送至兩個平台時,分數會顯示在 Hugging Face 模型頁面與基準測試排行榜上,但會附帶來源徽章。此徽章直接連結回完整的 EEE JSON 記錄,提供生成設定、harness 版本與可重現性說明的存取。
技術實作與轉換工具
為了簡化流程,Hugging Face 推出了將 EEE 記錄轉換為社群評估所需 YAML 格式的轉換器。
映射與支援的基準測試
轉換器將特定的 EEE 欄位映射至社群評估的 YAML 欄位:
source_data.hf_repo$\rightarrow$dataset.idevaluation_name$\rightarrow$task_idscore_details.score$\rightarrow$valueevaluation_timestamp$\rightarrow$date
此工具目前支援四個官方基準測試:MMLU-Pro、GPQA、HLE 與 GSM8K。
工作流程與驗證
轉換器不僅僅是重新整理資料;它在推送變更前會執行一系列稽核:
- 資料取得: 下載指定的 EEE 資料庫集合,並驗證物件雜湊值。
- 稽核: 讀取模型主分支上現有的
.eval_resultsYAML 檔案以及開放的 PR,以檢查是否已有分數。 - 衝突偵測: 結果會被標記為
already_present、score_conflict(若存在不同分數)或missing_hf_model(若倉庫在 Hub 上無法解析)。有效的條目會標記為ready。 - 人工批准: 不會自動推送資料。工具會產生本地 YAML 預覽與審查檔案。只有在使用者明確輸入
OPEN PRS並提供提交訊息後,才會開啟 PR。
入門指南
研究人員與評估者可透過提交完整記錄至 EEE 資料庫來貢獻。若要自動化提交至 Hugging Face,可使用 every_eval_ever GitHub 倉庫中提供的社群評估轉換工具,指令如下:
uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch