QIMMA:以品質為先的阿拉伯語大型語言模型排行榜

QIMMA 是一個全新的阿拉伯語大型語言模型(LLM)排行榜,會在評估模型之前先驗證基準測試,以確保報告的分數真實反映阿拉伯語的語言能力。它透過在模型測試前對資料集套用多階段驗證流程,解決了現有阿拉伯語自然語言處理評估中普遍存在的碎片化與品質問題。

解決阿拉伯語 NLP 評估的碎片化問題

阿拉伯語 NLP 評估歷來呈現碎片化且受到品質問題的困擾。QIMMA 在當前環境中辨識出四個主要痛點:

  • 翻譯產物:許多基準測試是從英文翻譯而來,導致分布轉移與文化不符的問題。
  • 缺乏驗證:本土阿拉伯語基準測試常缺乏嚴格的品質檢查,導致標註不一致與錯誤的金標答案。
  • 可重現性缺口:缺少公開的評估腳本與逐樣本輸出,使得審核結果變得困難。
  • 覆蓋範圍缺口:現有排行榜往往只聚焦於狹窄領域或孤立任務。

QIMMA 以開源、使用 99% 本土阿拉伯語內容、實施系統化品質驗證(包括程式碼評估)以及提供公開的逐樣本推論輸出而與眾不同。

QIMMA 資料集與領域覆蓋

QIMMA 整合了來自 14 個來源基準測試的 109 個子集,形成超過 52,000 筆樣本的統一套件。評估涵蓋七個不同領域與三種任務類型:

領域 基準測試 任務類型
文化 AraDiCE-Culture, ArabCulture, PalmX MCQ
STEM ArabicMMLU, GAT, 3LM STEM MCQ
法律 ArabLegalQA, MizanQA MCQ, QA
醫療 MedArabiQ, MedAraBench MCQ, QA
安全 AraTrust MCQ
詩歌與文學 FannOrFlop QA
程式碼 3LM HumanEval+, 3LM MBPP+ Code

值得注意的是,QIMMA 是首個透過阿拉伯語改編的 HumanEval+ 與 MBPP+ 版本整合程式碼評估的阿拉伯語排行榜,得以使用阿拉伯語問題敘述來評估程式碼能力。

品質驗證流程

QIMMA 採用多階段驗證流程,在任何模型評估之前先清理基準測試。

階段 1:多模型自動評估

兩個最先進的 LLM——Qwen3-235B-A22B-Instruct 與 DeepSeek-V3-671B——會獨立依據 10 分量表為每個樣本打分。若任一模型給予低於 7/10 的分數,該樣本即被剔除。若僅有一個模型標記樣本,則交由人工審核。

階段 2:人工標註與審查

具備文化與方言熟悉度的阿拉伯語母語者會審查被標記的樣本。這些標註者針對方言細微差異、文化背景與主觀詮釋作最終決策,以確保真實答案的正確性與文化敏感度。

阿拉伯語基準測試的系統性品質問題

驗證流程顯示,品質問題是系統性的而非孤立的。不同基準測試的剔除率各異,其中 ArabicMMLU 的剔除率最高,達 3.1%(436 筆樣本),MizanQA 為 2.3%(41 筆樣本)。

問題被歸類為四種類型的分類法:

  1. 答案品質:事實錯誤的答案或金標索引不匹配。
  2. 文字與格式品質:拼寫/文法錯誤、文字損毀或重複樣本。
  3. 文化敏感度:單一化的概括或刻板印象的強化。
  4. 金標答案符合性:金標答案與評估規範之間的不一致。

程式碼基準測試的精緻化

由於程式碼基準測試無法直接剔除,團隊對 3LM 改編的 HumanEval+ 與 MBPP+ 中的阿拉伯語問題敘述進行了精緻化。最終有 88% 的 3LM HumanEval+ 提示與 81% 的 3LM MBPP+ 提示被修改,以提升語言精緻度、清晰度與結構修正。

評估框架與指標

QIMMA 使用 LightEval、EvalPlus 與 FannOrFlop 作為評估框架,以確保可重現性。指標依任務類型分配如下:

  • MCQ:正規化對數似然準確率。
  • 多選 MCQ:金標選項的機率質量。
  • 生成式 QA:F1 BERTScore(使用 AraBERT v02)。
  • 程式碼:Pass@1。

提示採用六種模板類型(MCQ、MCQ-C、MCQ-I、QA、QA-C、QA-F)標準化,全部以阿拉伯語撰寫。

排行榜結果與洞見

截至 2026 年 4 月,表現最佳的模型包括:

  • 總體領先者:Qwen/Qwen3.5-397B-A17B-FP8(平均分 68.06)。
  • 文化與語言專家:Jais-2-70B-Chat 在 ArabicMMLU 與 ArabCulture 中領先。
  • 領域專家:Karnak 在 3LM STEM 與 ArabLegalQA 中領先。
  • 程式碼表現:多語言模型,特別是 Qwen3.5-397B,持續在程式碼任務中領先。

從結果中得到的關鍵發現包括:模型規模並不一定保證在所有領域都有最佳表現,且阿拉伯語專屬模型常常在文化與語言任務上超越規模相當的多語言模型。

Sources