ヘブライ語 LLM 用 Hugging Face オープンリーダーボード

Hugging Face は、ヘブライ語の大規模言語モデル(LLM)向けにオープンリーダーボードを導入し、一般的な LLM ベンチマークで十分に評価されてこなかった言語に対して標準化された評価フレームワークを提供します。この取り組みは、ヘブライ語特有の形態的複雑性に対応することで、言語的・文化的に正確なモデルの開発を促進することを目的としています。

ヘブライ語の言語的課題への対応

ヘブライ語は、語根とパターンからなる複雑な体系を持つ形態的に豊かな言語で、接頭辞・接尾辞・中置辞が意味、時制、数を変化させます。従来のトークナイゼーション手法は形態的にシンプルな言語向けに設計されていることが多く、ヘブライ語には効果が薄いことが頻繁にあります。その結果、既存の LLM が言語の微妙なニュアンスを処理しきれないギャップが生じ、これら独自の言語特性を反映した専用ベンチマークが必要となります。

評価指標とベンチマーク

リーダーボードは、ヘブライ語の理解と生成をテストするために 4 つの主要データセットを使用します。これらのベンチマークは、限られたコンテキストでモデルが適応し正しく応答できるよう、 few‑shot プロンプト形式を採用しています。

Hebrew Question Answering

このタスクは、ヘブライ語の構文と意味を理解し、提供されたコンテキストに基づいて正確に回答を取得するモデルの能力を評価します。HeQ データセットのテストサブセットを使用します。

Sentiment Accuracy

このベンチマークは、言語的手がかりに基づいてヘブライ語の文を肯定、否定、または中立に分類するモデルの能力を評価します。Hebrew Sentiment データセットを使用します。

Winograd Schema Challenge

このタスクは、代名詞の解決と文脈的曖昧性の処理を、論理的推論と一般的な世界知識を用いて測定します。Dr. Vered Schwartz が提供した Winograd Schema Challenge のヘブライ語翻訳を使用します。

Translation

このベンチマークは、英語とヘブライ語間の翻訳におけるモデルの熟練度を評価し、言語的正確性、流暢さ、意味の保持に焦点を当てます。NeuLabs-TedTalks 整合翻訳コーパスを使用します。

技術実装

リーダーボードは Demo Leaderboard template を使用して構築され、Open LLM Leaderboard にインスパイアされています。技術パイプラインは以下のように動作します:

  • Deployment: 提出されたモデルは Hugging Face Inference Endpoints を通じて自動的にデプロイされます。
  • Evaluation: モデルは lighteval ライブラリで管理された API リクエストを通じて評価されます。

スポンサーシップと協働

本プロジェクトは DDR&D IMOD / The Israeli National Program for NLP in Hebrew and Arabic のスポンサーのもと、DICTA: The Israel Center for Text AnalysisWebiks の協働で実施されています。科学的な相談と指導は、Bar‑Ilan University の Prof. Reut Tsarfaty が提供しました。

Sources