Hugging Face Community Evals と Every Eval Ever (EEE) の統合

Hugging Face Community Evals と Every Eval Ever (EEE) の統合

Hugging Face は、Hugging Face Community Evals と Every Eval Ever (EEE) の間の相互運用性を有効にし、評価結果を両方のプラットフォーム間でクロス投稿および解釈できるようにしました。この統合により、オープンモデルとリーダーボードが統一された標準化されたメタデータストアにリンクされ、AI評価報告の断片化が解消されます。

評価報告のギャップの解決

AIの評価結果は現在、論文、ブログ投稿、リーダーボードに分散しており、多くの場合、一貫性のない形式が使用されています。この標準化の欠如は、評価者や使用された設定によって、同じベンチマーク上の同じモデルが異なるスコアを報告するという不一致につながります。例えば、LLaMA 65B は、MMLU スコアが 63.7 と 48.8 の両方で報告されています。

これを解決するために、EvalEval Coalition によって 2026 年 2 月に開始された Every Eval Ever (EEE) プロジェクトは、評価結果のための単一の JSON スキーマを提供します。このスキーマは、以下の重要なメタデータを記録します:

  • 評価者の識別
  • 使用されたモデル
  • アクセス方法
  • 生成設定
  • メトリクスの定義
  • サンプルごとの出力を記録するためのオプションのコンパニオン JSONL ファイル

2026 年 6 月現在、Hugging Face 上の EEE データストアには、31 の異なる報告形式から派生した、22,000 以上のモデルと 2,200 のベンチマークをカバーする約 229,000 件の評価結果が含まれています。

Community Evals と EEE がどのように連携するか

Community Evals と EEE は、モデル評価エコシステムにおいて補完的な役割を果たします。Hugging Face はユーザーがモデルを発見するための可視化レイヤーを提供し、一方で EEE は完全な技術的記録を含む解釈可能性レイヤーを提供します。

Hugging Face Community Evals

Community Evals は、以下の 2 つのメカニズムを通じて Hub 上のベンチマーク報告を分散化します:

  1. Benchmark Registration: ベンチマークは eval.yaml ファイルを持つデータセットリポジトリに存在し、Hub 全体でそのベンチマークに対して報告されたすべてのスコアのリーダーボードを生成します。
  2. Model Score Reporting: スコアは、モデルリポジトリ内の .eval_results/*.yaml に YAML ファイルとして保存されます。これらのスコアはモデルカードに表示され、ベンチマークのリーダーボードに反映されます。結果は、モデルの作成者、プルリクエストを介したコミュニティ、または独立した検証者によって提出されることができます。

統合レイヤー

結果が両方のプラットフォームに送信されると、スコアは Hugging Face のモデルページとベンチマークリーダーボードに表示されますが、ソースバッジが付与されます。このバッジは、完全な EEE JSON レコードに直接リンクしており、生成構成、harness バージョン、および再現性のための注記へのアクセスを提供します。

技術的実装とコンバーターツール

プロセスを合理化するために、Hugging Face は、EEE レコードを Community Evals で必要な YAML 形式に変換するコンバーターを導入しました。

マッピングとサポートされているベンチマーク

コンバーターは、特定の EEE フィールドを Community Evals YAML フィールドにマッピングします:

  • source_data.hf_repo $\rightarrow$ dataset.id
  • evaluation_name $\rightarrow$ task_id
  • score_details.score $\rightarrow$ value
  • evaluation_timestamp $\rightarrow$ date

このツールは現在、4 つの公式ベンチマークをサポートしています:MMLU-Pro, GPQA, HLE, および GSM8K

ワークフローと検証

コンバーターは単にデータを整形するだけではありません。変更をプッシュする前に、一連の監査を行っています:

  1. Data Retrieval: 指定された EEE データストアのコレクションをダウンロードし、オブジェクトのハッシュを検証します。
  2. Audit: モデルのメインブランチと開いている PR を読み取り、既存のスコアをチェックして既存の .eval_results YAML を確認します。
  3. Conflict Detection: 結果は、already_presentscore_conflict(異なるスコアが存在する場合)、または missing_hf_model(リポジトリが Hub 上で解決できない場合)としてフラグが立てられます。有効なエントリは ready とマークされます。
  4. Human Approval: データは自動的にプッシュされません。ツールはローカルの YAML プレビューとレビューファイルを作成します。ユーザーが明示的に OPEN PRS と入力し、コミットメッセージを提供した後にのみ、PR が作成されます。

Getting Started

研究者や評価者は、EEE データストアに完全なレコードを提出することで貢献できます。Hugging Face への提出を自動化するには、every_eval_ever GitHub リポジトリで利用可能な community eval converter ツールを、以下のコマンドを使用して使用できます:

uv run tools/hf-community-evals/community_evals_converter.py MMLU-Pro --datastore evaleval/EEE_datastore@main

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch