Hugging Face 在 Hub 上的評估

Hugging Face 已推出 Evaluation on the Hub,這是一個由 AutoTrain 提供動力的無程式碼工具,讓使用者能在 Hugging Face 生態系統內直接使用任何指標對任何模型在任何資料集上進行評估。此工具透過消除手動評估的技術障礙,並提升報告結果的可重現性,以因應現代 AI 的「評估危機」。

標準化 Hub 上的模型評估

Evaluation on the Hub 透過將評估直接整合到 Hub 基礎設施中,簡化了測量模型效能的流程。與其依賴可能因實作差異或錯誤而不可靠的自行報告結果,該工具允許將已驗證的效能指標直接編碼到模型卡的中繼資料中。

Key capabilities include:

  • 尋找最佳模型:使用者可以存取特定資料集的排行榜,以辨識表現最佳的模型,或對尚未列出的新模型進行評估。
  • 建立基線:使用者可以將新資料集上傳至 Hub,並在多個模型上執行基線測試,無需撰寫程式碼。
  • 跨資料集驗證:模型開發者可以在眾多相關資料集上評估同一模型,以測試其泛化能力。

技術整合與工作流程

Evaluation on the Hub 透過 Spaces 與 AutoTrain 的結合,整合至現有的 Hugging Face 生態系統中。工作流程通常從資料集頁面開始,導向 model-evaluator Space。

設定評估工作

雖然許多資料集已包含允許一鍵評估的中繼資料,使用者仍可透過 Advanced configuration 手動設定工作,內容包括:

  • 任務與切分選擇:定義要使用的特定機器學習任務、資料集與資料切分。
  • 資料集映射:將資料集欄位映射至標準格式(例如,指定哪些欄位為影像、哪些為標籤)。
  • 指標選擇:從與任務相關的預設指標(如準確率或 F1 分數)中挑選,或選擇專門指標,例如 Matthew 相關係數。

執行與結果

當使用者選定要評估的模型並提交工作後,後端(由 AutoTrain 提供動力)會自動執行評估。結果隨即透過 Pull Request (PR) 回傳至模型的模型卡,確保效能資料透明且已驗證。使用者亦可將評估中繼資料複製至資料集卡,以簡化社群未來的評估流程。

應對 AI 評估危機

Hugging Face 將 Evaluation on the Hub 定位為回應 AI 基準測試系統性問題的方案。公司指出,儘管硬體與演算法快速進步,評估方法卻停滯不前,導致以下關鍵問題:

  • 基準飽和:模型在某些測試集上超越人類的速度快於新基準的建立速度。
  • 脆弱性與偏見:高排行榜分數常掩蓋 AI 系統底層的惡意偏見或脆弱性。
  • 缺乏可重現性:缺乏開放性與標準化實作,使得重現報告結果變得困難。
  • 部署被忽視:實務考量如效率與公平性常被拋棄,僅關注原始的準確率指標。

未來路線圖

Evaluation on the Hub 基於 Hugging Face evaluate 函式庫以及現有的基準如 RAFT 與 GEM。Hugging Face 計畫擴充此工具以支援更多任務,並整合全新且改進的資料測量工具,朝向更全面、可信且可重現的評估範式前進。

Sources