QIMMA: 品質第一のアラビア語LLMリーダーボード

QIMMA は、ベンチマークを検証した上でモデルを評価し、報告されたスコアが実際のアラビア語能力を正しく反映していることを保証する新しいアラビア語大規模言語モデル(LLM)リーダーボードです。マルチステージの検証パイプラインをデータセットに適用し、モデルテスト前に品質を確保することで、既存のアラビア語 NLP 評価に見られる断片化と品質問題に対処します。

アラビア語NLP評価の断片化解決

アラビア語 NLP 評価は歴史的に断片化され、品質問題に悩まされてきました。QIMMA は現在の状況における 4 つの主要な課題を特定します。

  • 翻訳アーティファクト: 多くのベンチマークが英語から翻訳されており、分布シフトや文化的に不適切な質問が生じる。
  • 検証不足: ネイティブのアラビア語ベンチマークは厳格な品質チェックが欠如しており、注釈の不整合や誤ったゴールド回答が発生する。
  • 再現性のギャップ: 公開された評価スクリプトやサンプル単位の出力が不足しているため、結果の監査が困難である。
  • カバレッジのギャップ: 既存のリーダーボードは狭いドメインや孤立したタスクに偏りがちである。

QIMMA はオープンソースであり、99% がネイティブアラビア語コンテンツで構成され、体系的な品質検証(コード評価を含む)を実装し、サンプル単位の推論出力を公開しています。

QIMMA データセットとドメインカバレッジ

QIMMA は 14 のソースベンチマークから 109 のサブセットを統合し、52,000 件以上のサンプルからなる統一スイートを提供します。評価は 7 つの異なるドメインと 3 種類のタスクに跨ります。

ドメイン ベンチマーク タスクタイプ
文化 AraDiCE-Culture, ArabCulture, PalmX MCQ
STEM ArabicMMLU, GAT, 3LM STEM MCQ
法務 ArabLegalQA, MizanQA MCQ, QA
医療 MedArabiQ, MedAraBench MCQ, QA
安全性 AraTrust MCQ
詩・文学 FannOrFlop QA
コーディング 3LM HumanEval+, 3LM MBPP+ Code

特に、QIMMA は HumanEval+ と MBPP+ のアラビア語版を統合した初のコード評価を提供し、アラビア語の問題文を用いたコーディング能力の測定を可能にします。

品質検証パイプライン

QIMMA は、モデル評価が行われる前にベンチマークをクリーンアップするマルチステージ検証パイプラインを採用しています。

ステージ1: マルチモデル自動評価

最先端 LLM 2 つ(Qwen3-235B-A22B-InstructDeepSeek-V3-671B)が各サンプルを 10 点満点のルーブリックで独立評価します。いずれかのモデルが 7/10 未満と評価したサンプルは除外されます。片方だけがフラグを立てた場合は人間レビューに回ります。

ステージ2: 人間による注釈とレビュー

文化的・方言的な知識を持つネイティブスピーカーがフラグ付けされたサンプルをレビューします。方言のニュアンス、文化的文脈、主観的解釈について最終判断を下し、ゴールド回答の正確性と文化的配慮を確保します。

アラビア語ベンチマークにおける体系的品質問題

検証パイプラインにより、品質問題は個別ではなく体系的であることが明らかになりました。ベンチマークごとの除外率は異なり、ArabicMMLU が最も高く 3.1%(436 件)、MizanQA が 2.3%(41 件)でした。

問題は以下の 4 種類に分類されます。

  1. 回答品質: 事実誤りやゴールドインデックスの不一致。
  2. テキスト・フォーマット品質: スペル・文法ミス、破損テキスト、重複サンプル。
  3. 文化的感受性: 単一的な一般化やステレオタイプの強化。
  4. ゴールド回答の遵守: 評価プロトコルとゴールド回答の不整合。

コードベンチマークのリファイン

コードベンチマークは単純に除外できないため、3LM が適用した HumanEval+ と MBPP+ のアラビア語問題文を精緻化しました。その結果、3LM HumanEval+ の 88%、3LM MBPP+ の 81% のプロンプトが言語的な洗練、明確化、構造修正のために変更されました。

評価フレームワークと指標

QIMMA は再現性を確保するために LightEvalEvalPlusFannOrFlop を評価フレームワークとして使用します。指標はタスクタイプに応じて割り当てられます。

  • MCQ: 正規化対数尤度精度。
  • マルチセレクト MCQ: ゴールド選択肢への確率質量。
  • 生成型 QA: F1 BERTScore(AraBERT v02 使用)。
  • Code: Pass@1。

プロンプトは 6 種類のテンプレート(MCQ、MCQ-C、MCQ-I、QA、QA-C、QA-F)で標準化され、すべてアラビア語で記述されています。

リーダーボード結果と洞察

2026 年 4 月時点での上位モデルは以下の通りです。

  • 総合リーダー: Qwen/Qwen3.5-397B-A17B-FP8(平均スコア 68.06)。
  • 文化・言語スペシャリスト: Jais-2-70B-ChatArabicMMLUArabCulture でトップ。
  • ドメインスペシャリスト: Karnak3LM STEMArabLegalQA でリード。
  • コーディング性能: 多言語モデル、特に Qwen3.5-397B がコードタスクで依然としてトップ。

結果から得られた主な知見は、モデル規模がすべてのドメインで最高性能を保証するわけではなく、アラビア語に特化したモデルが文化・言語タスクにおいてサイズが同等の多言語モデルを上回ることが多い、という点です。

Sources