EvalEval と UK AISI が先端 LLM ベンチマーク用のオープン評価カードをリリース

TL;DR

EvalEval と UK AI セキュリティ研究所 (AISI) は、HealthBench、FrontierMath、Humanity’s Last Exam、SWE‑Bench Pro、Terminal‑Bench 2.0 の5つの著名なベンチマークについて、公開検証済みの評価カードをリリースしました。これらのカードは6つの先端 LLM をカバーしており、再現可能な評価に必要な完全な構成、計算リソース、プロトコルの詳細を提供しています。

再現可能な評価報告が重要な理由

再現性は、評価結果がモデルの性能や安全性に関する主要な証拠としてますます重要になっているため不可欠です。現在の報告はフォーマットやプラットフォームごとに分散しており、推論時の計算リソース、評価プロトコル、データ分割といった重要な詳細がしばしば欠落しています。これにより、実験の再実行が極めて高コストになります。EvalEval は以下の2つの主要な成果物でこのギャップを埋めます。

  • Every Eval Ever (EEE) スキーマ – ベンチマークメタデータ、モデルメタデータ、実行時パラメータのための共有かつ機械可読な仕様。
  • 評価カード – EEE準拠の記録を格納するオープンアクセスポータル。スコアと正確な実験設定をリンクします。

AISI の効率的かつ統計的に厳密な評価に関する研究(例:OptStop、HiBayES)と連携することで、報告のギャップを診断し、透明な評価のための標準化インフラを提供することを目指しています。

AISI が共有している内容

AISI は、最近の論文 How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930) に記載された5つのベンチマークについて、評価カードをアップロードしました。各カードには以下の内容が含まれます:

  • 各ベンチマークの検証済みスコア。
  • モデルバージョン(Claude Opus 4, 4.5, 4.6;GPT‑5, 5.2, 5.4)、推論時の計算予算、トークン制限、評価プロトコルを含む完全な文脈。
  • プロンプトテンプレート、サンプリング設定、および任意のオラクルフィードバックメカニズムを含む構成詳細。

また、部分的に重複するモデルセットを使用する2つの補助的なサイバーセキュリティ評価(Cyber CTFs と The Last Ones)もリリースされています。これらの詳細を公開することで、研究者は以下を実現できます:

  • 計算リソースやプロトコルの変更が性能に与える影響を検討する(例:Humanity’s Last Exam のトークン効率曲線)。
  • 数値的に類似しているように見えるが、異なる条件下で得られた結果を比較する。
  • メタ研究や政策分析のための検証済み基準点としてカードを利用できる。

Humanity’s Last Exam における性能は評価プロトコルと推論時の計算リソースに依存する。各曲線は、特定のトークン数内に試行されたタスクの累積解決割合を示しており、各タスクで最初に観測された成功を用いている。

コミュニティが貢献できる方法

EvalEval コアリションは、以下の3つのグループに、エコシステムの拡張を促しています:

  • モデル開発者 – Get Verified ワークフローを通じて、自らのモデルの検証済み評価カードを提出。
  • ベンチマーク開発者 – オープンソースの EEE スキーマを使用して新しいベンチマークと実行データをエンコード(GitHub リンクを提供)。
  • 評価、ガバナンス、政策分野の研究者 – 公開カードリポジトリを活用して報告品質を評価し、メタ分析を実施する、または規制枠組みの構築に貢献する。

EvalEval コアリションについて

EvalEval コアリションは、AI評価のための堅牢で科学的に根拠のあるインフラを構築することに焦点を当てた研究コミュニティです。主なプロジェクトは以下の通りです:

  • Every Eval Ever – 評価結果のためのユニバーサルスキーマと公開リポジトリ。
  • 評価カード – ベンチマークメタデータ、実行時データ、モデルメタデータを集約し、解釈可能で比較可能な記録を提供するインターフェース。

これらのツールにより、同一のスコアが実質的に異なる実験条件から生じている場合を検出することが可能となり、評価に基づく意思決定の信頼性が向上します。

UK AI セキュリティ研究所 (AISI) について

AISI は、科学技術省に所属する英国政府の研究機関です。その使命は、先進的なAIのリスクについて政府に科学的知見を提供することです。AISI の活動には以下のものがあります:

  • OptStop – 成果が期待できない実行を早期に停止することで評価コストを削減する手法。
  • HiBayES – ハイエラルキカルベイズモデリングを用いて統計的に厳密な LLM 評価を実現。
  • ベンチマーク間でのトランスクリプト分析と能力抽出の標準化。

さらに読む

  • How Inference Compute Shapes Frontier LLM Evaluation (arXiv:2606.17930)
  • HiBayES: ハイエラルキカルベイズモデリングによる LLM 評価の改善 (AISI ブログ & arXiv:2505.05602)
  • OptStop 論文 (arXiv:2608.14425)
  • Every Eval Ever プロジェクトページ
  • 評価カードポータル

Sources