Hugging Face の Hub 上での評価

Hugging Face は Evaluation on the Hub を開始しました。これは AutoTrain が提供するノーコードツールで、ユーザーは Hugging Face エコシステム内で任意のモデルを任意のデータセット上で任意の指標を用いて評価できます。このツールは、手動評価の技術的ハードルを取り除き、報告された結果の再現性を向上させることで、現代 AI における「評価危機」に対処します。

Standardizing Model Evaluation on the Hub

Evaluation on the Hub は、評価を Hub のインフラストラクチャに直接統合することで、モデル性能の測定プロセスを簡素化します。実装の違いやバグの影響を受けやすい自己報告結果に依存する代わりに、このツールは検証済みの性能指標をモデルカードのメタデータに直接エンコードできるようにします。

主な機能は次のとおりです:

  • Finding Optimal Models: ユーザーはデータセット固有のリーダーボードにアクセスして上位モデルを特定したり、まだリストに載っていない新しいモデルの評価を実行したりできます。
  • Baseline Establishment: ユーザーは新しいデータセットを Hub にアップロードし、コードを書かずに複数のモデルに対してベースラインを実行できます。
  • Cross-Dataset Validation: モデル開発者は単一のモデルを多数の関連データセットで評価し、汎化性能をテストできます。

Technical Integration and Workflow

Evaluation on the Hub は、Spaces と AutoTrain の組み合わせを通じて既存の Hugging Face エコシステムに統合されています。ワークフローは通常、データセットページから開始し、model-evaluator Space に遷移します。

Configuring Evaluation Jobs

多くのデータセットはワンクリック評価を可能にするメタデータを含んでいますが、ユーザーは Advanced configuration を使用して手動でジョブを設定することもできます。設定項目は次のとおりです:

  • Task and Split Selection: 使用する機械学習タスク、データセット、データ分割を定義します。
  • Dataset Mapping: データセットの列を標準フォーマットにマッピングします(例: 画像が含まれる列とラベルが含まれる列を指定)。
  • Metric Selection: タスクに関連付けられたデフォルト指標(accuracy や F1 スコアなど)から選択するか、Matthew's correlation coefficient のような特殊指標を選択します。

Execution and Results

ユーザーが評価対象モデルを選択してジョブを送信すると、バックエンド(AutoTrain が提供)により自動的に評価が実行されます。結果は Pull Request (PR) を通じてモデルのモデルカードに送信され、性能データが透明かつ検証された形で Hub に反映されます。ユーザーは評価メタデータをデータセットカードにコピーして、コミュニティの将来の評価を円滑にすることもできます。

Addressing the AI Evaluation Crisis

Hugging Face は Evaluation on the Hub を、AI ベンチマークにおける体系的な課題への対応策として位置付けています。同社は、ハードウェアとアルゴリズムは急速に進化している一方で、評価手法は停滞しており、以下のような重大な問題が生じていると指摘しています:

  • Benchmark Saturation: 特定のテストセットでモデルが人間を上回る速度が、 新しいベンチマークの作成速度を超えている。
  • Brittleness and Bias: 高いリーダーボードスコアは、AI システムに潜む悪意あるバイアスや脆弱性を隠すことがある。
  • Lack of Reproducibility: オープン性と標準化された実装が欠如しているため、報告された結果を再現することが困難。
  • Deployment Overlooked: 実用的な関心事(効率性や公平性など)は、しばしば生の精度指標に比べて軽視される。

Future Roadmap

Evaluation on the Hub は Hugging Face の evaluate ライブラリと、RAFT や GEM といった既存ベンチマークを基盤としています。Hugging Face はこのツールを拡張し、より多くのタスクをサポートするとともに、新しく改良されたデータ測定ツールを統合して、より包括的で信頼性が高く再現可能な評価パラダイムへと進化させることを目指しています。

Sources