アラビア語リーダーボード:アラビア語指示遵守とAraGenの更新

Hugging Face と Inception は、モハメド・ビン・ザイード人工知能大学(MBZUAI)と協力して Arabic-Leaderboards Space を立ち上げました。この統合プラットフォームはアラビア語 AI 評価を一元化し、アラビア語指示遵守の初の公開ベンチマークを導入し、AraGen 生成リーダーボードを更新してアラビア語 LLM 評価の厳密性を向上させます。

アラビア語リーダーボードスペース

Arabic-Leaderboards Space は、さまざまなモダリティにわたるアラビア語 AI 評価の中心ハブとして機能します。現在、プラットフォームは AraGen-03-25Arabic Instruction Following の 2 つの主要なライブリーダーボードをホストしています。開発者は、研究が進むにつれて追加のリーダーボードやタスクをこのスペースに拡充することを計画しています。

AraGen-03-25 のリリースと評価

AraGen は、生成タスクにおける LLM のベンチマークを目的としたアラビア語生成リーダーボードです。最新リリースの AraGen-03-25 は、評価フレームワークにいくつかの重要な更新を導入しています。

データセットの拡張と分布

AraGen-03-25 データセットは 340 件の質問応答ペアに拡張され、前バージョンの 279 件から増加しました。タスクの分布は以下の通りです。

  • Question Answering: 約 200 ペア
  • Reasoning: 70 ペア
  • Safety Questions: 40 ペア
  • Orthographic and Grammatical Analysis: 30 ペア

動的評価とランキングの安定性

信頼性を確保するため、Inception はデータセットを 3 ヶ月間(ブラインドテスト)非公開にした後に公開する動的評価サイクルを採用しています。AraGen-12-24 benchmark が現在公開されており、Claude-3.5-Sonnet が 3C3H ガイドラインを用いて評価したモデル応答が含まれています。

分析では、以前のシステムプロンプト(SP1)と現在のシステムプロンプト(SP2)間のランキング変動は概ね安定していることが示されています。モデル o1-2024-12-17 は一貫してトップポジションを維持していますが、絶対スコアは 82.67%(AraGen-12-24)から 70.25%(AraGen-03-25)へと低下しており、更新されたベンチマークが大幅に難易度が上がったことを示しています。

3C3H 評価指標

3C3H 指標は、事実性と有用性に基づいてモデルのチャット能力を評価します。最近の分析からの重要な発見は、正確性、助けになること、無害性の間に高い相関がある一方で、conciseness(簡潔さ)は例外であることです。ほとんどのモデルは冗長さに対して報酬が与えられますが、分析では silma-ai/SILMA-9B-Instruct-v1.0 がより大きなオープンウェイトモデルよりも簡潔さで優れているものの、ベースモデルである google/gemma-2-9b-it と比較して助けになる度合いが犠牲になっていることが指摘されました。

アラビア語指示遵守(Arabic IFEval)

指示遵守とは、LLM が特定の客観的に測定可能な制約に従う能力です。Inception は、アラビア語向けの初の公開ベンチマークである Arabic IFEval を導入しました。

データセット構築

Google の英語 IFEval に触発され、Arabic IFEval データセットは約 300 件のプロンプトで構成されています。単純な翻訳ではなく、チームはアラビア語の言語的ニュアンスや文化的文脈を反映するようにプロンプトを適応させました。主な特徴は以下の通りです。

  • Linguistic Challenges: アラビア語の音声学、正字法、形態論に焦点を当てたプロンプト(例:母音記号/タシュキールの使用)。
  • Constraint Types: 特定の文字(例:アレフ)を避ける、特定の単語頻度を使用する、厳格な長さや句読点の制約を守るといった検証可能なコマンド。
  • Expert Validation: すべてのプロンプトはアラビア語学者によって文法的正確性と明瞭さが検証されています。

評価手法

評価は自動化された Python スクリプトで実施され、再現性を確保し AI ジャッジのバイアスを排除します。ベンチマークは二段階の精度を使用します。

  • Prompt-level strict accuracy: プロンプト内の すべて の指示が遵守された場合にのみ成功とみなす厳格な指標。
  • Instruction-level score: 部分的な遵守を評価する、より緩やかな指標。

パフォーマンス結果

アラビア語と英語の IFEval におけるプロンプトレベルの精度を比較した予備結果では、モデルは一般的に英語の方が優れています。例えば、claude-3.5-sonnet はアラビア語ランキングで 72.5% の精度でトップに立ち、英語では 84.7% です。アラビア語での他の上位パフォーマーは gpt-4o-2024-08-06(70.8%)と gpt-4o-mini-2024-07-18(68.1%)です。

今後のロードマップ

Inception と MBZUAI は、Arabic-Leaderboards Space の更新を継続する予定です。今後の追加として、camel-benchkitab によって支えられる視覚質問応答(VQA)用リーダーボードが予定されています。

Sources