allenai/vla-evaluation-harness

One framework to evaluate any VLA model on any robot simulation benchmark.

What it solves

Vision-Language-Action (VLA) 모델을 평가하는 것은 일반적으로 파편화되어 있습니다. LIBERO 나 CALVIN 과 같은 모든 로봇 시뮬레이션 벤치마크는 각자의 의존성, 관찰 형식, 및 평가 프로토콜을 가지고 있기 때문입니다. 이는 연구 팀이 각 벤치마크에 대해 별도의 프라이빗 포크를 유지 관리해야 하는 상황을 초래하며, 결과의 불일치와 실시간 조건에서의 표준화된 테스트 부족으로 이어집니다.

How it works

이 하네스는 두 가지 주요 메커니즘을 통해 모델과 벤치마크를 분리하는 추상화 레이어를 제공합니다:

  • Dockerized Benchmarks: 각 벤치마크 환경은 정확한 재현성을 보장하고 의존성 충돌을 피하기 위해 독립적인 Docker 이미지로 패키징됩니다.
  • Standalone Model Servers: 모델은 인라인 의존성 선언이 포함된 독립형 스크립트(uv 사용)로 제공되어, 한 번의 통합으로 지원되는 모든 벤치마크에서 평가할 수 있습니다.

평가 속도를 높이기 위해, 시스템은 Episode Sharding (여러 프로세스에 작업을 분할) 및 Batch Inference (요청을 단일 GPU 순전파로 그룹화)를 사용하여 최대 47배의 처리량을 높일 수 있습니다.

Who it’s for

VLA 모델과 Embodied AI를 연구하는 연구자 및 개발자로, 여러 로봇 시뮬레이션 벤치마크에서 모델을 평가하기 위한 통합되고 재현 가능한 방법이 필요한 사람들을 위한 것입니다.

Highlights

  • Massive Integration Matrix: OpenVLA, $\pi_0$, GR00T를 포함한 18개의 벤치마크와 13개의 공식 모델 서버를 지원합니다.
  • High Throughput: 배치 병렬 평가를 통해 단일 H100에서 2,000개 에피소드의 실행 시간을 14시간에서 18분으로 단축할 수 있습니다.
  • Zero Setup: Docker와 uv 스크립트를 사용하여 수동 환경 설정을 제거합니다.
  • Unified Leaderboard: 18개 벤치마크에 걸쳐 2,000개 이상의 모델 데이터를 집계합니다.
  • Observability: 에피소드 결과에 대한 내장 SQLite 기록 및 시각적 디버깅을 위한 선택적 비디오 캡처 기능이 포함되어 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트