allenai/vla-evaluation-harness

One framework to evaluate any VLA model on any robot simulation benchmark.

What it solves

评估 Vision-Language-Action (VLA) 模型通常是碎片化的,因为每个机器人模拟基准测试(如 LIBERO 或 CALVIN)都有其自身的依赖项、观察格式和评估协议。这通常导致研究团队必须为每个基准测试维护单独、私有的 fork,从而导致结果不一致,并缺乏在实时条件下进行标准化测试。

How it works

该工具架构提供了一个抽象层,通过两个主要机制将模型与基准测试解耦:

  • Dockerized Benchmarks: 每个基准测试环境都封装为独立的 Docker 镜像,以确保精确的复现性并避免依赖冲突。
  • Standalone Model Servers: 模型作为独立的脚本(使用 uv)提供服务,并带有内联依赖声明,使其能够被集成一次后,即可在任何支持的基准测试中进行评估。

为了加速评估,系统使用了 Episode Sharding(将任务拆分到多个进程)和 Batch Inference(将请求分组为单次 GPU 前向传播),这可以将吞吐量提高达 47 倍。

How it works

Who it’s for

研究人员和开发者,特别是从事 VLA 模型和具身智能 (Embodied AI) 的研究人员,需要一种统一、可复现的方式来评估其模型在多个机器人模拟基准测试中的表现。

Highlights

  • Massive Integration Matrix: 支持 18 个基准测试和 13 个官方模型服务器,包括 OpenVLA, $\pi_0$, 和 GR00T。
  • High Throughput: 批次并行评估可以在单个 H100 上将 2,000 个回合 (episodes) 的墙钟时间 (wall-clock time) 从 14 小时减少到 18 分钟。
  • Zero Setup: 使用 Docker 和 uv 脚本来消除手动环境配置。
  • Unified Leaderboard: 聚合了来自 18 个基准测试中超过 2,000 个模型的数据。
  • Observability: 内置 SQLite 记录回合结果,并提供可选的视频捕获功能以进行视觉化调试。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目