allenai/vla-evaluation-harness
One framework to evaluate any VLA model on any robot simulation benchmark.
What it solves
Vision-Language-Action (VLA) モデルの評価は、通常、断片化されています。LIBERO や CALVIN のような各ロボットシミュレーション・ベンチマークは、独自の依存関係、観測フォーマット、および評価プロトコルを持っています。これにより、研究チームは各ベンチマークに対して個別のプライベート・フォークを維持管理する必要があり、結果の不一致や、リアルタイム条件下での標準化されたテストの欠如につながります。
How it works
このハーネスは、主に 2 つのメカニズムを通じて、モデルとベンチマークを分離する抽象化レイヤーを提供します:
- Dockerized Benchmarks: 各ベンチマーク環境は、正確な再現性を確保し、依存関係の衝突を回避するために、スタンドアロンの Docker イメージとしてパッケージ化されています。
- Standalone Model Servers: モデルは、インライン依存関係宣言を備えたスタンドアロン・スクリプト(
uv を使用)として提供され、一度の統合で、サポートされているあらゆるベンチマークで評価が可能になります。
評価を高速化するため、システムは Episode Sharding(タスクを複数のプロセスに分割)と Batch Inference(リクエストを単一の GPU 前向伝播にグループ化)を使用しており、スループットを最大 47 倍向上させることができます。
Who it’s for
研究者や開発者で、VLA モデルやエンボディド AI (Embodied AI) に携わり、複数のロボットシミュレーション・ベンチマークにおいて、モデルを統一的かつ再現可能な方法で評価する必要がある人々。
Highlights
- Massive Integration Matrix: 18 個のベンチマークと 13 個の公式モデルサーバー(OpenVLA, $\pi_0$, GR00T を含む)をサポートしています。
- High Throughput: バッチ並列評価により、単一の H100 で 2,000 エピソードの実行時間を 14 時間から 18 分に短縮できます。
||
- Zero Setup: Docker と
uv スクリプトを使用して、手動の環境設定を排除します。
- Unified Leaderboard: 18 個のベンチマークにわたる 2,000 以上モデルのデータを集約しています。
- Observability: エピソードの結果を SQLite 記録、および視覚的なデバッグ用のオプションのビデオキャプチャ機能が組み込まれています。
関連
- プロジェクト
OpenBMB/DeepThinkVLADeepThinkVLAは、ロボットの行動を生成する前に明示的な連鎖的思考(CoT)の推論ステップを挿入する視覚言語行動モデルです。自己回帰的推論 → 並列行動生成というハイブリッドデコーダーを採用し、新たに作成されたエムベデッドCoTデータセットで訓練した後、成果志向の強化学習で最適化します。このモデルはLIBEROベンチマークで平均97 %の成功確率を達成し、純粋な自己回帰ベースラインの0.175×の遅延で動作し、新しいLIBERO Plusスイートへのゼロショット転移も可能になっています。
- プロジェクト
sou350121/VLA-Handbook継続的に更新されるオープンソースのハンドブックで、VLA(視覚言語行動)研究、エンジニアリングのテクニック、コミュニティノート、業界インテリジェンスを収集。再現可能なスクリプト、ハードウェアガイド、RSSフィード、AIアシスタントスキルを提供。CC-BY-4.0ライセンス下で運用。
- プロジェクト
dexmal/dexboticDexboticは、Vision-Language-Action (VLA) 研究のためのオープンソースのPyTorchツールボックスです。事前学習済みVLAモデル(π0, CogACT, OFT, MemVLAなど)、モジュール式学習/評価スクリプト、LoRAファインチューニング、クラウド対応の分散学習、および UR5, Franka, Unitree G1 SONIC などのロボット用のデプロイメント・ヘルパーが同梱されています。このプロジェクトは、Dockerイメージ、詳細なドキュメント、ベンチマーク表、および統一されたリアルタイム推論APIを提供し、すべて MIT ライセンスの下で提供されています。
- プロジェクト
dsta022/Loop-Engineering-for-VLALoop Engineering for VLAnything は、ビジョン・言語・アクションモデル向けのマルチモーダルロボット学習データセット(RGB、RGB-D、および将来の視覚触覚)を記録、マージ、監査、拡張、反復改善できるエンドツーエンドのPythonツールキットです。保守的でサイドカー最優先の品質監査、プラグイン可能な意味的評価器、言語アノテーションパイプライン、ポリシー改善のクローズドループを提供し、LeRobotデータフォーマットと互換性があり、Hugging Faceに公開可能です。
- プロジェクト
isaac-sim/IsaacLab-ArenaIsaac Lab‑Arena は、NVIDIA Isaac Lab のアルファ版オープンソース拡張で、再利用可能な *シーン*、*エン bodiment*、*タスク* プリミティブを組み合わせてロボットシミュレーション環境を構築できる。実行時にこれらをアセンブルし、シーケンシャルタスクチェーン、自然言語によるオブジェクト配置、大規模並列評価をサポート。一般化ロボットポリシーのベンチマークやトレーニングを容易にする。インストールは `uv` Pythonマネージャーまたは提供されたDockerイメージで可能。Linux専用で、NVIDIA GPUとIsaac Simが必要。プロジェクトはApache 2.0(独自のIsaac Simコンポーネントを含む)で、プロダクションではなく研究目的に向けられている。