Hugging Face Community Evals

Hugging Face は Community Evals を開始しました。これは、ベンチマークデータセットがリーダーボードをホストし、モデルが独自の評価スコアを保存できる分散型フレームワークです。このシステムは、プルリクエストを通じてコミュニティが結果を提出・検証できるようにすることで、モデル性能に関する単一の真実の情報源が欠如している問題を解消することを目指しています。

分散型評価レポーティング

Hugging Face は Hub 上での評価レポーティングを分散型モデルへとシフトしています。従来の集中型・ブラックボックスのリーダーボードに依存する代わりに、コミュニティがベンチマークのスコアをオープンに報告できる仕組みです。ロールアウトはまず 4 つのベンチマークのショートリストから始まり、今後はより多くの関連ベンチマークへと拡大していく予定です。

ベンチマークデータセット向け

データセットリポジトリはベンチマークとして登録できるようになりました(MMLU‑Pro、GPQA、HLE はすでに稼働中)。これらのリポジトリは Hub 全体から報告された結果を自動的に集約し、データセットカード内にリーダーボードを表示します。再現性を確保するため、ベンチマークは Inspect AI 形式に基づく eval.yaml ファイルで評価仕様を定義します。

モデルリポジトリ向け

評価スコアはモデルリポジトリの .eval_results/ ディレクトリ内に YAML ファイルとして保存されます。これらのスコアはモデルカードに表示され、ベンチマークデータセットへと供給されます。システムはモデル作者が提供した結果と、オープンなプルリクエストで提出された結果の両方を集約します。

コミュニティ向け

任意のユーザーがプルリクエストを通じて任意のモデルの評価結果を提出できます。これらの結果は「コミュニティ」スコアとして表示され、モデル作者が PR をマージする必要はありません。ユーザーは研究論文、モデルカード、サードパーティ評価プラットフォーム、または inspect 評価ログなど、裏付けとなる証拠へのリンクを付けることができます。Hub は Git ベースであるため、すべての評価追加・変更は透明な履歴として追跡されます。

評価ギャップへの対処

Community Evals は現在の AI 評価環境における主な 2 つのギャップに対処します。

  1. パフォーマンスギャップ: MMLU が 91% 超、GSM8K が 94% 超、HumanEval が「征服済み」といった高ベンチマークスコアと、ウェブ閲覧、実務コーディング、マルチステップ推論といった実世界タスクでの性能との間に、文書化された乖離があります。
  2. レポーティングギャップ: モデルカード、研究論文、各種評価プラットフォームで報告されるスコアに不一致が頻繁に見られ、統一された真実の情報源が欠如しています。

AI エコシステムへの影響

Hub API を通じて既存のスコアを公開することで、コミュニティは分野全体の性能をより容易に集約・追跡し、キュレートされたダッシュボードやリーダーボードを構築できます。Hugging Face はこのシステムがベンチマークの飽和やテストセットでの学習を防止するものではないことを認めつつ、何が評価され、どのように実施され、誰が評価を行っているかについての可視性を高めます。

最終的な目標は、Hub を再現可能なベンチマークを共有するアクティブな環境へと変革し、特に最先端モデルに挑戦を課す新たなタスクやドメインに焦点を当てることです。

Sources