開放阿拉伯語 LLM 排行榜 2
總覽
Hugging Face 與其合作夥伴已推出開放阿拉伯語 LLM 排行榜 2(OALL v2),這是一個經過改進的基準測試平台,旨在提供對支援阿拉伯語的大型語言模型(LLM)更準確且透明的評估。此更新將重點從機器翻譯任務轉移到本地阿拉伯語基準測試,以更好地捕捉該語言複雜的形態學、句法和文化細節。
解決阿拉伯語基準測試的限制
先前的阿拉伯語 LLM 排行榜常常因資源限制而受到影響,使用者必須依賴模型製造商的文件而非直接比較,並且由於缺乏對提交結果的中央驗證而導致完整性問題。
OALL v2 具體解決了在排行榜第一版及其他社區倡議中發現的不足:
- 減少翻譯偏見:許多 v1 任務是直接從英語翻譯而來,這引入了語言不匹配且未能反映真實世界的阿拉伯語使用情境。
- 基準測試飽和:隨著模型在數個 v1 基準測試上取得近乎滿分的成績,這些基準測試變得不再有效,使得無法區分模型的增量改進。
- 技術更正:AlGhafa 任務中的一個錯誤已被修復;先前,系統根據選項文本而非索引來評估回答,這導致較小或較弱的模型被不成比例地懲罰,最高可達 20 分。
OALL v2 中的新增與保留基準測試
OALL v2 遵循兩項指導原則:移除飽和及機器翻譯的任務,並添加高品質的本地或人工策劃基準測試。
保留的數據集
來自原始 OALL,排行榜保留了來自 AlGhafa 基準測試 的本地阿拉伯語數據集(包括人工策劃的 Facts-Balanced、SOCAL、XGLUE、Sentiment 和 Sentiment-Rating 版本)、Belebele(阿拉伯語 MSA 和阿拉伯語方言)以及 阿拉伯語 EXAMS 基準測試。
新增數據集
- 本地阿拉伯語 MMLU:包含 40 個任務,約有 15,000 個來源於學校考試的現代標準阿拉伯語(MSA)選擇題。
- 人工翻譯 MMLU (MMLU-HT):原始英語 MMLU 的 57 任務人工翻譯,由 Inception 作為 JAIS 項目的一部分進行策劃。
- MedinaQA:一個專注於阿拉伯語一般語言和語法方面的數據集。
- AraTrust:522 份由人類撰寫的選擇題,用於評估安全性和真實性。
ALRAGE 基準測試
OALL v2 引入了 ALRAGE(阿拉伯語檢索增強生成評估),這是一個用於評估阿拉伯語 RAG 能力的框架。
- 數據集:來源於多樣化主題的 40 本阿拉伯語書籍,使用 Meta-Llama-3.1-70B 進行合成生成,並透過與 Argilla 的社區衝刺由母語者進行驗證。
- 方法論:它透過
lighteval框架使用「LLM-as-judge」度量。Qwen2.5-72B-Instruct 擔任評判者,根據準確性、相關性和品質在 0-10 的評分規則上對回答進行評分,然後將其正規化到 0-1 的範圍。
效能分析與結果
OALL v1 與 OALL v2 的統計比較顯示,新基準測試如 AraTrust、ALRAGE 和更新後的 AlGhafa 在不同模型規模上的表現更為分散,而較舊的任務如 ACVA 和 Toxigen 則表現出顯著的飽和。
模型排名
- 頂尖表現者:Llama-3.3-70B-Instruct 在 OALL v2 的所有類別中已成為領導者。
- 預訓練模型:Qwen 系列模型繼續作為強大的基線;具體來說,Qwen/Qwen2-72B 超越 Qwen/Qwen2.5-72B,成為頂尖的預訓練/持續預訓練模型。
- 跨排行榜相關性:OALL v2 與其他排行榜(如 AraGen 和 SEAL 阿拉伯語)之間存在顯著相關性,Llama-3.3-70B-Instruct 在 OALL v2 和 AraGen 中均排名第一。
模型家族趨勢
對 AceGPT 和 Jais 家族的分析顯示,較大的模型通常能獲得更高的平均分數。然而,一個顯著的例外是 inceptionai/jais-family-30b-8k 模型,它在 OALL v2 上超越了較大的 inceptionai/jais-adapted-70b 模型。
作業變更
為確保計算資源的公平存取並鼓勵參與組織的多樣性,OALL v2 現在將每個組織每週的提交數量限制為五個模型。此外,排行榜現在支援聊天模板;如果在模型配置中找到模板,則會使用該模板進行評估。