Open Ko-LLM リーダーボード

TL;DR

Hugging Face と Upstage は、Open Ko-LLM Leaderboard を導入しました。これは、韓国語大規模言語モデル(LLM)向けの透明で競争的なエコシステムを育成することを目的とした、プライベートテストセットと韓国語特化ベンチマークを活用した専門評価プラットフォームです。データ汚染を防止し、韓国語の言語的・文化的ニュアンスを正確に測定することを目指しています。

プライベートテストセットによる公平なベンチマーク

Open Ko-LLM Leaderboard は、従来のベンチマークとは異なり、クローズドテストセット環境を採用しています。多くのリーダーボードがオープンテストセットを使用する中、Open Ko-LLM Leaderboard はデータ汚染(評価データでモデルが学習されてしまう問題)を防ぐためにデータセットをプライベートに保ち、モデル間の比較をより公平に行います。

文化的・言語的な適合性を確保するため、Ko-MMLU などの翻訳ベンチマークデータセットを利用し、韓国語とその文化の特性を反映した評価を行います。

評価タスクと指標

リーダーボードは、LLM の多様な能力を測定するために 5 つの評価手法を採用しています。

  • Ko-ARC (AI2 Reasoning Challenge): 科学的思考、複雑な推論、問題解決能力を評価する多肢選択テスト。正解率でパフォーマンスを測定します。
  • Ko-HellaSwag: 状況理解と次に起こり得るシナリオを予測する能力を評価します(生成形式または多肢選択形式)。主な指標は正確性です。
  • Ko-MMLU (Massive Multitask Language Understanding): 様々なトピックと分野にわたる広範な多肢選択テストで、一般的な言語理解と汎用性を測ります。全体の正確性と領域別パフォーマンスが指標となります。
  • Ko-Truthful QA: 複数の選択肢から事実の正確さと真実性を見極める能力をテストするベンチマーク。選択正確性で評価します。
  • Ko-CommonGEN V2: Open Ko-LLM Leaderboard 用に特別に開発されたカスタムベンチマークで、モデルが韓国の常識や文化的関連性に沿った出力を生成できるかを評価します。

採用状況とモデル性能の傾向

リリースから 5 カ月以内に、Open Ko-LLM Leaderboard には 1,000 件以上のモデル提出があり、元の英語版 Open LLM Leaderboard(4,000 件以上)の約 1/4 の規模に達しています。参加者は個人研究者、学術機関(例:KAIST、韓国大学)および企業(例:KT、ロッテ情報通信、ヤノルジャ)です。

主な観察結果は以下の通りです。

  • トップパフォーマー: クロスリンガル転移や韓国語特化のファインチューニングを施したモデル(例:Upstage の SOLAR)や、LLaMa2、Yi、Mistral といった強力な基盤モデルからファインチューニングされたモデルが最も高い成果を示しています。
  • 注目すべきマイルストーン: KT の Mi:dm 7B モデルは、パラメータ数 7B 以下のモデル部門でランキング首位となり、一般公開もされています。

インフラ課題と将来ビジョン

現在、リーダーボードは 16 台の A100 80GB GPU 上で運用されています。このインフラは、30 億パラメータを超える大規模モデルに対してボトルネックとなり、計算リソースの要求が高いために長時間待機状態になることがあります。

今後は、現行ベンチマークの 3 つの主要な制限を解消することを目指しています。

  1. データの陳腐化: SQUAD や KLEU といった固定データセットから脱却し、時事性を反映したデータを取り入れる。
  2. 実世界応用: B2B・B2C サービスで見られるエッジケースや外れ値への対応力を測定する手法を開発する。
  3. 過学習: テストセットに特化した「リーダーボード中心」アプローチを減らし、実際のユーティリティに焦点を当てる。

最終的な目標は、学術研究と実務応用のギャップを埋め、実世界のユースケースと強く相関するベンチマークを組み込むことで、より実用的な評価エコシステムを構築することです。

Sources