Hugging Face Judge Arena: 將LLMs作為評估者進行基準測試
Hugging Face 已推出 Judge Arena,這是一個設計用來識別最適合作為評估者的 LLMs 的眾包平台。此工具解決了確定哪些模型最適合採用「LLM-as-a-Judge」方法的迫切需求,其中 AI 模型會對其他 AI 應用程式的自然語言輸出進行評分。
眾包評估框架
Judge Arena 使用隨機的側邊對戰系統來基準測試 AI 評判。此方法論基於在 LMSys 的 Chatbot Arena 等平台上看到的眾包基準測試成功經驗。該流程遵循特定的工作流程以確保客觀結果:
- 樣本選擇:使用者可以選擇一個樣本進行評估,無論是讓系統隨機生成 User Input/AI Response 配對,或是提供自訂樣本。
- 雙重評估:兩位匿名的 LLM 評判對回應進行評分,並提供詳細的評分理由。
- 人工投票:使用者檢閱評分和批評,並投票給評估結果最符合自己判斷的評判。
為防止偏見和濫用,模型身份在投票提交之前將保持隱藏。
模型選擇標準
Judge Arena 專注於生成式模型,排除僅輸出分數的分類模型。要進入競技場,模型必須滿足兩項主要標準:
- 評分與批評能力:該模型必須能夠有效地為其他模型的輸出進行評分並提供批評。
- 提示能力:該模型必須能夠被提示以使用不同的評分格式和標準進行評估。
該平台目前包含來自專有和開源提供者的 18 個最先進的 LLMs,包括:
- OpenAI:GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo
- Anthropic:Claude 3.5 Sonnet / Haiku, Claude 3 Opus / Sonnet / Haiku
- Meta:Llama 3.1 Instruct Turbo (405B, 70B, 8B)
- Alibaba:Qwen 2.5 Instruct Turbo (7B, 72B), Qwen 2 Instruct 72B
- Google:Gemma 2 (9B, 27B)
- Mistral:Instruct v0.3 7B, Instruct v0.1 7B
效能指標與早期見解
Judge Arena 使用 Elo 評分系統來計算每個模型的分數,排行榜會每小時更新一次。平台的早期觀察顯示出幾個關鍵趨勢:
- 開源性能競爭力:雖然 GPT-4 Turbo 目前以微弱優勢領先,但 Llama 和 Qwen 模型具有高度競爭力,並超越了大多數專有模型。
- 小型模型的效率:Qwen 2.5 7B 和 Llama 3.1 8B 展現出令人印象深刻的表現,能夠有效地與更大型的模型競爭。
- Llama 作為基礎模型的驗證:初步結果顯示 Llama 3.1 70B 和 405B 分別排名第 2 和第 3。這與現有研究(如 Lynx、Auto-J 和 SFR-LLaMA-3.1-Judge)一致,表明 Llama 模型是評估任務的強大基礎模型。
社群貢獻與資料分享
為了支援更一致的評估器開發,Hugging Face 和 Atla 承諾在未來幾個月內分享 20% 的匿名投票資料。該平台開放社群提供回饋與建議,以將新模型加入排行榜。