阿拉伯排行榜:阿拉伯指令遵循與 AraGen 更新

Hugging Face 與 Inception 與穆罕默德·本·扎耶德人工智慧大學(MBZUAI)合作,推出了 Arabic-Leaderboards Space。此統一平台集中阿拉伯 AI 評估,推出首個公開的阿拉伯指令遵循基準測試,並更新 AraGen 生成式排行榜,以提升阿拉伯大型語言模型(LLM)評估的嚴謹性。

Arabic-Leaderboards Space

Arabic-Leaderboards Space 作為阿拉伯 AI 評估的中心樞紐,涵蓋各種模態。目前平台提供兩個主要的即時排行榜:AraGen-03-25Arabic Instruction Following。開發者計畫隨著研究進展,擴充此空間以加入更多排行榜與任務。

AraGen-03-25 版本與評估

AraGen 是一個生成式阿拉伯排行榜,旨在對大型語言模型(LLM)的生成任務進行基準測試。最新版本 AraGen-03-25 為評估框架帶來多項關鍵更新。

資料集擴充與分佈

AraGen-03-25 資料集已擴增至 340 組問答對,較前一版本的 279 組有所增加。任務分佈如下:

  • Question Answering: 約 200 組
  • Reasoning: 70 組
  • Safety Questions: 40 組
  • Orthographic and Grammatical Analysis: 30 組

動態評估與排名穩定性

為確保可靠性,Inception 採用動態評估週期,資料集在公開前保持三個月的私密(盲測)狀態。AraGen-12-24 benchmark 現已公開發布,包含使用 3C3H 指南由 Claude-3.5-Sonnet 評估的模型回應。

對先前系統提示 (SP1) 與目前系統提示 (SP2) 之排名變化的分析顯示,排名大致保持穩定。模型 o1-2024-12-17 持續位居首位,儘管其絕對分數從 82.67%(AraGen-12-24)下降至 70.25%(AraGen-03-25),顯示更新後的基準測試更具挑戰性。

3C3H 評估指標

3C3H 指標根據事實性與可用性評估模型的聊天能力。近期分析的關鍵發現是正確性、幫助性與無害性之間高度相關,而 conciseness(簡潔性)則為例外。大多數模型因冗長而獲得較高評分,然而分析指出 silma-ai/SILMA-9B-Instruct-v1.0 的簡潔性高於較大的開放權重模型,但相較於其基礎模型 google/gemma-2-9b-it,在幫助性上有所犧牲。

Arabic Instruction Following(Arabic IFEval)

指令遵循是大型語言模型(LLM)遵守特定、客觀可測量限制的能力。Inception 推出了 Arabic IFEval,這是首個針對阿拉伯語的公開基準測試。

資料集建構

受 Google 英文 IFEval 啟發,Arabic IFEval 資料集包含約 300 個提示。團隊並非僅做簡單翻譯,而是調整提示以符合阿拉伯語的語言細節與文化背景。主要特點包括:

  • Linguistic Challenges: 聚焦於阿拉伯語音、正字法與形態學的提示(例如使用變音符號/塔什基爾)。
  • Constraint Types: 可驗證的指令,例如避免使用特定字母(如 Alef)、使用特定詞頻,或遵守嚴格的長度與標點限制。
  • Expert Validation: 所有提示皆由阿拉伯語言學家驗證,以確保語法正確與清晰。

評估方法論

評估透過自動化 Python 腳本執行,以確保可重現性並消除 AI 評審偏見。此基準測試使用兩層次的準確度:

  • Prompt-level strict accuracy: 嚴格指標,僅在提示內所有指令皆被遵守時才視為成功。
  • Instruction-level score: 較寬鬆的指標,評估部分遵守情況。

效能結果

初步結果比較阿拉伯語與英文 IFEval 的提示層級準確度,顯示模型在英文上普遍表現較佳。例如,claude-3.5-sonnet 以 72.5% 的準確度領先阿拉伯語排行榜,而英文則為 84.7%。其他阿拉伯語的頂尖模型包括 gpt-4o-2024-08-06(70.8%)與 gpt-4o-mini-2024-07-18(68.1%)。

未來路線圖

Inception 與 MBZUAI 計畫持續更新 Arabic-Leaderboards Space。未來將加入由 camel-benchkitab 支援的視覺問答(VQA)排行榜。

Sources