BenCzechMark: チェコ語 LLM 用の包括的評価スイート

Hugging Face は、BUT FIT、FI MUNI、CIIRC CTU と協力して、チェコ語の大規模言語モデル(LLM)の能力を評価するために設計された初の包括的評価スイート BenCzechMark を導入しました。このベンチマークは、推論、文法の正確性、チェコ文化に関する事実知識、言語モデリング確率を測定する標準化されたフレームワークを提供します。

ベンチマークの構成とタスクカテゴリ

BenCzechMark は 50 のタスク9 つのカテゴリ にまたがり、コンテンツの 90% がチェコ語のネイティブ、10% が翻訳(主に CUBBITT と DeepL)です。スイートは以下の次元でモデルを評価します:

  • 読解: Belebele(Accuracy)と SQAD3.2(Exact Match)を使用して、コンテキストからの情報抽出をテストします。
  • 事実知識: Umimeto(Accuracy)、TriviaQA(Exact Match)、NaturalQuestions(Exact Match)を通じて蓄積された知識をテストします。
  • チェコ語理解: CERMAT(EM/AUROC/Acc)、Grammar Error Detection(AUC)、Agree(Accuracy)を使用して構文とニュアンスに焦点を当てます。
  • 言語モデリング: Czech National Corpus(Perplexity)と HellaSwag(Accuracy)を通じてテキストサンプリングの尤度を測定します。
  • チェコ語での数学的推論: Klokan QA(Accuracy)、CERMAT(Exact Match/Accuracy)、Umimeto Math(Accuracy)を使用して問題解決能力を評価します。
  • 自然言語推論: Czech SNLI(AUROC)、CSFever(AUROC)、CTKFacts(AUROC)、Propaganda(AUROC)を使用して含意とサポートをテストします。
  • 固有表現認識(NER): CNEC2.0(Exact Match)と Court Decisions(Exact Match)を使用してエンティティタイプを識別します。
  • 感情分析: Subjectivity(AUROC)と CzechSentiment(AUROC)で感情を定量化します。
  • 文書検索: Historical IR(Accuracy)を使用して関連パッセージを特定します。

評価指標

多様なタスクタイプに対応するため、ベンチマークは以下の 4 つの主要指標を採用しています:

  1. Accuracy (Acc): 多肢選択タスク向け。
  2. Exact Match (EM): 開放型短答生成向け。
  3. Area Under the Receiver Operating Characteristic Curve (AUROC): 分類に使用され、閾値調整の必要性を排除し、モデル間の比較をより公平にします。
  4. Word-level Perplexity (Ppl): 言語モデリングタスク向けで、コーパス内の単語ごとに正規化されます。

新しいデュエルスコアリングメカニズム

ベンチマークはスケールが異なる複数の指標を使用するため、単純平均は実用的ではありません。BenCzechMark は最終順位を決定するために Duel Win Score (DWS) を導入します。

各タスクについて、モデルは α=0.05 の統計的有意性検定で比較されます。使用される検定は、ACC と EM 用の片側対応 t 検定、AUROC 用のベイズ検定、Ppl 用のブートストラップです。モデルの DWS は、特定のタスクで他のすべてのモデルに対して勝利した「デュエル」の割合です。最終的な総合スコアは マクロ平均モデル勝率 で、カテゴリごとの DWS の平均として計算されます。

モデル性能とリーダーボード結果

26 のオープンウェイトモデル(3ショット例、2048 トークンの入力長、対数確率集約に平均プーリングを使用)を評価した結果、以下の主要な発見が得られました:

  • Llama-405B はリーダーボード全体で最も高性能なモデルです。
  • Qwen-72B は数学と情報検索で優れた性能を示しましたが、他のカテゴリでは遅れを取っています。
  • Aya-23-35B は感情分析と語彙モデリングで卓越しています。
  • Gemma-2 9B はチェコ語読解において、はるかに大きなモデルを上回りました。

研究者や開発者は、専用の Hugging Face Space を通じて自分のモデルを BenCzechMark リーダーボードに提出し、チェコ語特化型 LLM の開発を促進できます。

Sources