allenai/vla-evaluation-harness

One framework to evaluate any VLA model on any robot simulation benchmark.

What it solves

Vision-Language-Action (VLA) モデルの評価は、通常、断片化されています。LIBERO や CALVIN のような各ロボットシミュレーション・ベンチマークは、独自の依存関係、観測フォーマット、および評価プロトコルを持っています。これにより、研究チームは各ベンチマークに対して個別のプライベート・フォークを維持管理する必要があり、結果の不一致や、リアルタイム条件下での標準化されたテストの欠如につながります。

How it works

このハーネスは、主に 2 つのメカニズムを通じて、モデルとベンチマークを分離する抽象化レイヤーを提供します:

  • Dockerized Benchmarks: 各ベンチマーク環境は、正確な再現性を確保し、依存関係の衝突を回避するために、スタンドアロンの Docker イメージとしてパッケージ化されています。
  • Standalone Model Servers: モデルは、インライン依存関係宣言を備えたスタンドアロン・スクリプト(uv を使用)として提供され、一度の統合で、サポートされているあらゆるベンチマークで評価が可能になります。

評価を高速化するため、システムは Episode Sharding(タスクを複数のプロセスに分割)と Batch Inference(リクエストを単一の GPU 前向伝播にグループ化)を使用しており、スループットを最大 47 倍向上させることができます。

Who it’s for

研究者や開発者で、VLA モデルやエンボディド AI (Embodied AI) に携わり、複数のロボットシミュレーション・ベンチマークにおいて、モデルを統一的かつ再現可能な方法で評価する必要がある人々。

Highlights

  • Massive Integration Matrix: 18 個のベンチマークと 13 個の公式モデルサーバー(OpenVLA, $\pi_0$, GR00T を含む)をサポートしています。
  • High Throughput: バッチ並列評価により、単一の H100 で 2,000 エピソードの実行時間を 14 時間から 18 分に短縮できます。 ||
  • Zero Setup: Docker と uv スクリプトを使用して、手動の環境設定を排除します。
  • Unified Leaderboard: 18 個のベンチマークにわたる 2,000 以上モデルのデータを集約しています。
  • Observability: エピソードの結果を SQLite 記録、および視覚的なデバッグ用のオプションのビデオキャプチャ機能が組み込まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト