allenai/vla-evaluation-harness
One framework to evaluate any VLA model on any robot simulation benchmark.
What it solves
Vision-Language-Action (VLA) 모델을 평가하는 것은 일반적으로 파편화되어 있습니다. LIBERO 나 CALVIN 과 같은 모든 로봇 시뮬레이션 벤치마크는 각자의 의존성, 관찰 형식, 및 평가 프로토콜을 가지고 있기 때문입니다. 이는 연구 팀이 각 벤치마크에 대해 별도의 프라이빗 포크를 유지 관리해야 하는 상황을 초래하며, 결과의 불일치와 실시간 조건에서의 표준화된 테스트 부족으로 이어집니다.
How it works
이 하네스는 두 가지 주요 메커니즘을 통해 모델과 벤치마크를 분리하는 추상화 레이어를 제공합니다:
- Dockerized Benchmarks: 각 벤치마크 환경은 정확한 재현성을 보장하고 의존성 충돌을 피하기 위해 독립적인 Docker 이미지로 패키징됩니다.
- Standalone Model Servers: 모델은 인라인 의존성 선언이 포함된 독립형 스크립트(
uv 사용)로 제공되어, 한 번의 통합으로 지원되는 모든 벤치마크에서 평가할 수 있습니다.
평가 속도를 높이기 위해, 시스템은 Episode Sharding (여러 프로세스에 작업을 분할) 및 Batch Inference (요청을 단일 GPU 순전파로 그룹화)를 사용하여 최대 47배의 처리량을 높일 수 있습니다.
Who it’s for
VLA 모델과 Embodied AI를 연구하는 연구자 및 개발자로, 여러 로봇 시뮬레이션 벤치마크에서 모델을 평가하기 위한 통합되고 재현 가능한 방법이 필요한 사람들을 위한 것입니다.
Highlights
- Massive Integration Matrix: OpenVLA, $\pi_0$, GR00T를 포함한 18개의 벤치마크와 13개의 공식 모델 서버를 지원합니다.
- High Throughput: 배치 병렬 평가를 통해 단일 H100에서 2,000개 에피소드의 실행 시간을 14시간에서 18분으로 단축할 수 있습니다.
- Zero Setup: Docker와
uv 스크립트를 사용하여 수동 환경 설정을 제거합니다.
- Unified Leaderboard: 18개 벤치마크에 걸쳐 2,000개 이상의 모델 데이터를 집계합니다.
- Observability: 에피소드 결과에 대한 내장 SQLite 기록 및 시각적 디버깅을 위한 선택적 비디오 캡처 기능이 포함되어 있습니다.
관련
- 프로젝트
OpenBMB/DeepThinkVLADeepThinkVLA는 로봇 행동을 생성하기 전에 명시적인 사고 흐름(Chain-of-Thought) 단계를 삽입하는 시각-언어-행동 모델입니다. 자가회귀적 추론 → 병렬 동시 행동 생성을 결합한 하이브리드 디코더를 사용하며, 새로 구축한 몸체화된 CoT 데이터셋으로 훈련한 후 성과 중심 강화학습으로 보완합니다. 이 모델은 LIBERO 벤치마크에서 평균 97 %의 성공률을 달성하고, 순수 자가회귀 기반 대비 0.175×의 지연만을 가지며, 더 새로운 LIBERO Plus 스위트로 제로샷 전이가 가능합니다.
- 프로젝트
sou350121/VLA-Handbook지속적으로 업데이트되는 오픈소스 핸드북으로, VLA(시각-언어-행동) 연구, 엔지니어링 기술, 커뮤니티 노트, 산업 인텔리전스를 수집합니다. 재현 가능한 스크립트, 하드웨어 가이드, RSS 피드, AI 어시스턴트 기능을 제공하며, CC-BY-4.0 라이선스 하에 운영됩니다.
- 프로젝트
dexmal/dexboticDexbotic은 시각-언어-행동(VLA) 연구를 위한 오픈소스 PyTorch 도구상자입니다. π0, CogACT, OFT, MemVLA 등 사전 훈련된 VLA 모델, 모듈식 훈련/평가 스크립트, LoRA 미세 조정, 클라우드 대응 분산 훈련, UR5, Franka, Unitree G1 SONIC 등의 로봇을 위한 배포 보조 도구를 통합합니다. Docker 이미지, 광범위한 문서, 벤치마크 표, 통합 실시간 추론 API를 제공하며, MIT 라이선스 하에 배포됩니다.
- 프로젝트
dsta022/Loop-Engineering-for-VLALoop Engineering for VLAnything는 RGB, RGB-D, 그리고 미래의 시각-촉각 데이터를 포함하는 다중 모달 로봇 학습 데이터셋을 기록, 병합, 감사, 확장, 반복 개선할 수 있는 엔드투엔드 파이썬 툴킷입니다. 보수적이고 사이드카 중심의 품질 감사, 플러그인 가능한 의미 평가기, 언어 어노테이션 파이프라인, 정책 개선을 위한 클로즈드 루프를 제공하며, LeRobot 데이터 형식과 호환되며 Hugging Face에 게시 가능합니다.
- 프로젝트
isaac-sim/IsaacLab-ArenaIsaac Lab‑Arena는 NVIDIA Isaac Lab의 알파 단계 오픈소스 확장으로, 재사용 가능한 *장면*, *엔 bodiment*, *태스크* 프리미티브를 조합하여 로봇 시뮬레이션 환경을 구축할 수 있게 해줍니다. 실행 시 이들을 조립하고, 순차적 태스크 체이닝, 자연어 기반 물체 배치, 대규모 병렬 평가를 지원하여 일반화된 로봇 정책의 벤치마킹 또는 트레이닝을 쉽게 만듭니다. 설치는 `uv` Python 매니저 또는 제공된 Docker 이미지로 가능하며, Linux 전용이며 NVIDIA GPU와 Isaac Sim이 필요합니다. 프로젝트는 Apache 2.0 라이선스(독점적인 Isaac Sim 구성 요소 포함)이며, 생산용이 아니라 연구용으로 의도되어 있습니다.