Hugging Face 社群評估

Hugging Face 推出了 Community Evals,一個去中心化的框架,允許基準資料集托管排行榜,模型則可自行儲存評估分數。此系統旨在透過讓社群以 pull request 提交與驗證結果,消除模型效能缺乏單一真實來源的問題。

去中心化的評估報告

Hugging Face 正在將 Hub 上的評估報告模式轉向去中心化。系統不再依賴集中式、黑箱的排行榜,而是允許社群公開報告基準分數。此推廣首先從四個基準開始,未來計畫擴展至更多相關基準。

針對基準資料集

資料集倉庫現在可以註冊為基準(已經上線的有 MMLU‑Pro、GPQA 與 HLE)。這些倉庫會自動彙總來自整個 Hub 的報告結果,並在資料集卡片中顯示排行榜。為確保可重現性,基準會透過基於 Inspect AI 格式的 eval.yaml 檔案定義其評估規格。

針對模型倉庫

評估分數會以 YAML 檔案形式儲存在模型倉庫的 .eval_results/ 目錄下。這些分數會顯示在模型卡片上,並輸入至基準資料集。系統會彙總模型作者提供的結果以及透過公開 pull request 提交的結果。

針對社群

任何使用者皆可透過 pull request 為任意模型提交評估結果。這些結果會以「社群」分數顯示,無需模型作者合併 PR。使用者可以連結支援證據,例如研究論文、模型卡片、第三方評估平台,或 inspect 評估日誌。由於 Hub 基於 Git,所有評估的新增與變更皆以透明的歷史紀錄追蹤。

解決評估缺口

社群評估針對當前 AI 評估領域的兩大主要缺口提出解決方案:

  1. 效能缺口:已記錄的高基準分數(例如 MMLU 超過 91%、GSM8K 超過 94%,以及 HumanEval 已被「征服」)與實際應用中的表現(如網頁瀏覽、正式程式開發、多步驟推理)之間存在落差。
  2. 報告缺口:模型卡片、研究論文與各種評估平台所報告的分數常常不一致,導致缺乏統一的真實來源。

對 AI 生態系統的影響

透過 Hub API 公開現有分數,社群能更輕鬆地彙總與追蹤全領域的效能,並打造精選的儀表板與排行榜。雖然 Hugging Face 承認此系統無法解決基準飽和或防止在測試集上進行訓練,但它提升了對評估內容、執行方式以及評估者的可見度。

最終目標是將 Hub 轉變為一個活躍的環境,用於分享可重現的基準,特別聚焦於挑戰最先進模型的新任務與領域。

Sources