allenai/vla-evaluation-harness

One framework to evaluate any VLA model on any robot simulation benchmark.

What it solves

評估 Vision-Language-Action (VLA) 模型通常是碎片化的,因為每個機器人模擬基準測試(例如 LIBERO 或 CALVIN)都有其自身的依賴項、觀察格式與評估協定。這通常導致研究團隊必須為每個基準測試維護獨立且私有的 fork,進而導致結果不一致,且缺乏在即時條件下的標準化測試。

How it works

該工具架構提供了一個抽象層,透過兩個主要機制將模型與基準測試解耦:

  • Dockerized Benchmarks: 每個基準測試環境都封裝為獨立的 Docker 映像檔,以確保完全的可重現性並避免依賴項衝突。
  • Standalone Model Servers: 模型以獨立腳本(使用 uv)的形式提供服務,並附帶內聯依賴項宣告,使其能夠被整合一次後,即可在任何支援的基準測試中進行評估。

為了加速評估,系統使用了 Episode Sharding(將任務拆分到多個程序)與 Batch Inference(將請求分組為單次 GPU 前向傳播),這可以將吞吐量提高達 47 倍。

Who it’s for

研究人員與開發人員,特別是從事 VLA 模型與具身智能 (Embodied AI) 的研究人員,需要一種統一且可重現的方式來評估其模型在多個機器人模擬基準測試中的表現。

Highlights

  • Massive Integration Matrix: 支援 18 個基準測試與 13 個官方模型伺服器,包括 OpenVLA, $\pi_0$, 與 GR00T。
  • High Throughput: 批次平行評估可以在單個 H100 上將 2,000 個回合 (episodes) 的牆鐘時間 (wall-clock time) 從 14 小時縮短至 lib 18 分鐘。
  • Zero Setup: 使用 Docker 與 uv 腳本來消除手動環境配置。
  • Unified Leaderboard: 整合了來自 18 個基準測試中超過 2,000 個模型的數據。
  • Observability: 內建 SQLite 記錄回合結果,並提供可選的影片擷取功能以進行視覺化除錯。",

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案