Hugging Face 在 Hub 上的評估
Hugging Face 已推出 Evaluation on the Hub,這是一個由 AutoTrain 提供動力的無程式碼工具,讓使用者能在 Hugging Face 生態系統內直接使用任何指標對任何模型在任何資料集上進行評估。此工具透過消除手動評估的技術障礙,並提升報告結果的可重現性,以因應現代 AI 的「評估危機」。
標準化 Hub 上的模型評估
Evaluation on the Hub 透過將評估直接整合到 Hub 基礎設施中,簡化了測量模型效能的流程。與其依賴可能因實作差異或錯誤而不可靠的自行報告結果,該工具允許將已驗證的效能指標直接編碼到模型卡的中繼資料中。
Key capabilities include:
- 尋找最佳模型:使用者可以存取特定資料集的排行榜,以辨識表現最佳的模型,或對尚未列出的新模型進行評估。
- 建立基線:使用者可以將新資料集上傳至 Hub,並在多個模型上執行基線測試,無需撰寫程式碼。
- 跨資料集驗證:模型開發者可以在眾多相關資料集上評估同一模型,以測試其泛化能力。
技術整合與工作流程
Evaluation on the Hub 透過 Spaces 與 AutoTrain 的結合,整合至現有的 Hugging Face 生態系統中。工作流程通常從資料集頁面開始,導向 model-evaluator Space。
設定評估工作
雖然許多資料集已包含允許一鍵評估的中繼資料,使用者仍可透過 Advanced configuration 手動設定工作,內容包括:
- 任務與切分選擇:定義要使用的特定機器學習任務、資料集與資料切分。
- 資料集映射:將資料集欄位映射至標準格式(例如,指定哪些欄位為影像、哪些為標籤)。
- 指標選擇:從與任務相關的預設指標(如準確率或 F1 分數)中挑選,或選擇專門指標,例如 Matthew 相關係數。
執行與結果
當使用者選定要評估的模型並提交工作後,後端(由 AutoTrain 提供動力)會自動執行評估。結果隨即透過 Pull Request (PR) 回傳至模型的模型卡,確保效能資料透明且已驗證。使用者亦可將評估中繼資料複製至資料集卡,以簡化社群未來的評估流程。
應對 AI 評估危機
Hugging Face 將 Evaluation on the Hub 定位為回應 AI 基準測試系統性問題的方案。公司指出,儘管硬體與演算法快速進步,評估方法卻停滯不前,導致以下關鍵問題:
- 基準飽和:模型在某些測試集上超越人類的速度快於新基準的建立速度。
- 脆弱性與偏見:高排行榜分數常掩蓋 AI 系統底層的惡意偏見或脆弱性。
- 缺乏可重現性:缺乏開放性與標準化實作,使得重現報告結果變得困難。
- 部署被忽視:實務考量如效率與公平性常被拋棄,僅關注原始的準確率指標。
未來路線圖
Evaluation on the Hub 基於 Hugging Face evaluate 函式庫以及現有的基準如 RAFT 與 GEM。Hugging Face 計畫擴充此工具以支援更多任務,並整合全新且改進的資料測量工具,朝向更全面、可信且可重現的評估範式前進。
Sources
- OriginalAnnouncing Evaluation on the Hub