介紹 Open Arabic LLM Leaderboard
Hugging Face 與科技創新研究院(TII)已推出 Open Arabic LLM Leaderboard(OALL),這是一個專門用於評估與比較阿拉伯語大型語言模型(LLMs)表現的平台。此倡議針對自然語言處理(NLP)領域的資源缺口——過去評估工具多偏向英語——提供一種標準化方式,以提升服務超過 3.8 億阿拉伯語使用者的模型。
全面基準資料集
OALL 使用多樣且健全的資料集,以確保在各種語言任務上對模型能力進行全面評估:
- AlGhafa Benchmark: 由 TII LLM 團隊開發,此基準評估閱讀理解、情感分析與問答。它包含 11 個原生阿拉伯語資料集以及 11 個翻譯自廣泛採用的英語 NLP 基準的版本。
- ACVA and AceGPT Benchmarks: 這些基準包括來自「AceGPT, Localizing Large Language Models in Arabic」論文的 58 個資料集,以及 MMLU 與 EXAMS 基準的翻譯版本,以涵蓋廣泛的語言複雜性與細微差異。
評估指標與技術基礎設施
排行榜採用 normalized log likelihood accuracy 作為主要指標。此選擇特別適用於基準資料集中使用的多選題與是/否題型,提供不同任務類型間公平的效能衡量。
在技術層面,OALL 使用以下技術堆疊構建:
- Framework: 使用
lighteval函式庫執行評估。團隊透過 PR #44 與 PR #95 將阿拉伯語基準整合至lighteval,讓社群能直接進行評估。 - Architecture: 前端與後端的設計靈感來自
demo-leaderboard,後端則在 TII 叢集本地部署。
模型提交指南
為維護排行榜的完整性,參與者必須遵守模型提交的特定技術要求:
- Precision Alignment: 模型的精度必須與原始模型保持一致,以確保正確的顯示與評估。
- Compatibility: 模型必須能透過
AutoClasses(AutoConfig、AutoModel、AutoTokenizer)載入,且設定為公開可見。 - Weight Format: 權重必須轉換為 safetensors,以加速載入並在 Extended Viewer 中顯示參數數量。
- Licensing: 僅接受開放授權的模型,以促進可取得性。
- Documentation: 必須提供完整的模型卡,因為此資訊會自動提取用於排行榜顯示。
未來路線圖與社群目標
OALL 團隊計畫透過多項即將推出的倡議擴大平台範圍:
- Specialized Leaderboards: 開發新類別,包括針對 Retrieval Augmented Generation(RAG)情境的排行榜,以及基於使用者偏好的 ELO 分數的聊天機器人競技場。
- OpenDolphin Benchmark: 開放式復刻「Dolphin: A Challenging and Diverse Benchmark for Arabic NLG」論文,將包含約 50 個資料集。
- Cross-Language Application: 此專案旨在作為藍圖,為其他資源不足的語言打造類似的大規模、語言特定排行榜,以縮小全球 NLP 資源差距。