3LM: アラビア語LLM向けSTEMとコードのベンチマーク

3LM (علم) は、アラビア語大型言語モデル(LLM)を STEM(科学、技術、工学、数学)分野とコード生成で評価するために設計されたマルチコンポーネントベンチマークです。従来の評価は感情分析や要約といった汎用タスクに主に焦点を当てており、構造化された推論や形式論理に対する評価が不足していたという、アラビア語 NLP の重要なギャップに対処します。

ベンチマークコンポーネント

3LM は、技術領域におけるモデルの能力を包括的に把握するため、異なる評価軸を対象とした 3 つの独立したデータセットで構成されています。

1. ネイティブ STEM

Native STEM は、教科書、ワークシート、8 年生から 12 年生向けの試験バンクなど、実際のアラビア語教育資料から抽出された 865 の選択式問題(MCQ)で構成されています。データセットは、物理学、化学、生物学、数学、地理学の 5 つの主要科目をカバーしています。各問題には、領域と難易度(1〜10 の評価)のメタデータが含まれます。作成パイプラインは OCR、Pix2Tex を用いた LaTeX 数式パース、LLM 支援抽出、手動レビューを利用しました。

2. 合成 STEM

より高難度の推論をテストし、回答バイアスを低減するため、Synthetic STEM コンポーネントには YourBench パイプラインで作成された 1,744 の MCQ が含まれています。このプロセスは、アラビア語教科書テキストを分割・要約し、それを LLM 主導の質問生成システムへの入力として使用します。生成された質問は、中〜高難度の概念的、分析的、応用的問題に焦点を当てており、手動レビューにより検証されています。

3. アラビア語コードベンチマーク

3LM は、HumanEval+ と MBPP+ ベンチマークを翻訳・適応することで、自然言語プログラミングプロンプトに対するアラビア語 LLM のテスト用コードデータセットを初めて導入します。プロンプト翻訳には GPT-4o を使用し、バックトランスレーションパイプライン(ROUGE-L F1 < 0.8 のサンプルを除外)と人手フィルタリングにより品質を確保しました。スコアの忠実性を保つため、元のコードとテストスイートは変更せず、評価は EvalPlus フレームワークを用いて pass@1 と pass@1+ 指標で行います。

主な評価結果

40 以上の LLM を評価した結果、タスク形式やモデルごとに異なる強みが明らかになりました。

  • 選択式質問: Qwen2.5-72B-Instruct が最高性能を示し、ネイティブ STEM で 71.8%、合成 STEM で 67.0% のスコアを獲得しました。
  • 生成的完了: Gemma-3-27B は STEM 解答で 43.2% の正確度という最も高い結果を示しました。
  • コード生成: GPT-4o は HumanEval-ar で 83.5% の pass@1+、MBPP-ar で 63.6% の pass@1+ を達成し、ベンチマークをリードしました。

分析により、アラビア語と英語の pass@1 スコア間に強い相関(約 0.97)があることが示され、言語固有のプロンプト品質がモデルの結果に大きく影響することが分かりました。さらに、指示チューニングされたモデルは、妨害要素の摂動に対してベースモデルよりも著しく安定していることが確認されました。

実装とツール

3LM は再現性を重視して設計され、標準的な評価ツールと統合されています。

  • lighteval: STEM データセットの選択式および自由回答形式の質問評価の両方に使用されます。
  • evalplus: 関数レベルのテストを通じた堅牢な pass@1 および pass@1+ コードスコアリングに使用されます。

すべての評価スクリプト、設定、パイプラインは GitHub で公開されており、OpenAI API または HuggingFace Transformers と互換性のある任意のモデルをサポートします。

データセットへのアクセス

すべての 3LM データセットはオープンソースで、HuggingFace Datasets で入手可能です。

  • 3LM-native-stem
  • 3LM-synthetic-stem
  • 3LM-code-arabic

Sources