3LM:阿拉伯語大型語言模型在 STEM 與程式碼領域的基準測試

3LM:阿拉伯語大型語言模型在 STEM 與程式碼領域的基準測試

3LM(علم)是一個多元組件的基準測試,旨在評估阿拉伯語大型語言模型(LLM)在 STEM(科學、技術、工程與數學)科目以及程式碼生成方面的表現。它填補了阿拉伯語自然語言處理領域的一個關鍵空白,此前的評估主要集中在情感分析、摘要等通用任務,而非結構化推理與形式邏輯。

基準測試組件

3LM 包含三個不同的資料集,針對不同的評估面向,提供模型在技術領域能力的全面觀察。

1. 原生 STEM

原生 STEM 包含 865 題多項選擇題(MCQ),來源於正統的阿拉伯語教育資源,包括教科書、練習紙與 8 至 12 年級的考試題庫。資料集涵蓋五大核心科目:物理、化學、生物、數學與地理。每題皆附有領域與難度(1–10 級)的中繼資料。製作流程使用 OCR、透過 Pix2Tex 的 LaTeX 數學解析、LLM 輔助抽取以及人工審核。

2. 合成 STEM

為測試更高難度的推理並降低答案偏差,合成 STEM 組件包含 1,744 題使用 YourBench 流程製作的多項選擇題。此流程先將阿拉伯語教科書文本切塊並摘要,然後作為 LLM 驅動的題目生成系統的輸入。產生的題目聚焦於中高難度的概念、分析與應用型問題,並經由人工審核驗證。

3. 阿拉伯語程式碼基準測試

3LM 推出首個程式碼資料集,用於測試阿拉伯語 LLM 在自然語言程式設計提示上的表現,透過翻譯與改編 HumanEval+ 與 MBPP+ 基準測試完成。提示翻譯使用 GPT-4o,並透過回譯流程(剔除 ROUGE-L F1 < 0.8 的樣本)與人工過濾確保品質。為維持評分的忠實度,原始程式碼與測試套件保持不變,評估則使用 EvalPlus 框架的 pass@1 與 pass@1+ 指標。

主要評估結果

對超過 40 個 LLM 的評估顯示,各模型在不同任務形式上展現出不同的優勢。

  • Multiple-Choice Questions: Qwen2.5-72B-Instruct 在原生 STEM 上取得最高表現,得分 71.8%,在合成 STEM 上得分 67.0%。
  • Generative Completion: Gemma-3-27B 在 STEM 答案上展現最強結果,準確率為 43.2%。
  • Code Generation: GPT-4o 在基準測試中領先,HumanEval-ar 的 pass@1+ 為 83.5%,MBPP-ar 的 pass@1+ 為 63.6%。

分析顯示,阿拉伯語與英語的 pass@1 分數之間具有高度相關性(約 0.97),說明語言特定提示的品質對模型結果有顯著影響。此外,指令微調模型在受到干擾擾動時,穩定性遠高於基礎模型。

實作與工具

3LM 設計上注重可重現性,並與標準評估工具整合:

  • lighteval: 用於 STEM 資料集的多項選擇題與開放式問題評估。
  • evalplus: 透過函式層級測試,提供 robust 的 pass@1 與 pass@1+ 程式碼評分。

所有評估腳本、設定與流程皆於 GitHub 開放,支援任何相容於 OpenAI API 或 HuggingFace Transformers 的模型。

資料集取得

所有 3LM 資料集皆為開源,並可於 HuggingFace Datasets 取得:

  • 3LM-native-stem
  • 3LM-synthetic-stem
  • 3LM-code-arabic

Sources