H-EmbodVis/TurboVLA
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA – 실시간 비전-언어-행동 모델
무엇인가요 – TurboVLA는 원시 카메라 이미지와 자연어 지시를 직접 로봇 관절 동작으로 매핑하는 연구용 신경 정책입니다. 일반적인 "비전 → 대규모 언어 모델 → 행동" 파이프라인을 가벼운 V + L → A 아키텍처로 대체하여, RTX 4090에서 32 Hz의 추론을 달성하면서 1 GB 미만의 VRAM을 사용합니다.
핵심 아이디어
- 비전(DINOv3 ViT‑B/L)과 언어(BERT‑base)를 위한 별도의 인코더.
- GroundingDINO 기반의 양방향 비전-언어 상호작용 모듈을 통해 대규모 LLM 없이 두 모달리티 간 정보 교환을 가능하게 합니다.
- 연속적인 행동 청크(12단계(LIBERO), 50단계(RoboTwin))를 예측하는 컴팩트한 디코더로 지연 시간을 추가로 줄입니다.
성능
- LIBERO 벤치마크: 평균 성공률 97.7 %, 파라미터 수 0.2 B, 지연 시간 31 ms, VRAM 0.9 GB.
- 더 큰 VLA 기준 모델과 동등하거나 이를 초과하면서도 실행 비용은 훨씬 낮습니다.
시작 방법
- 클론 및 설정 – 리포지토리는 두 가지 선택적 환경을 제공합니다:
turbovla-libero: LIBERO 시뮬레이션 스위트용.turbovla-robotwin: RoboTwin 2.0 로봇 시뮬레이터용.
- 의존성 설치 – CUDA 호환 PyTorch 빌드를 설치한 후,
pip install -e "[libero]"또는"[robotwin]"확장 기능을 사용합니다. - 모델 및 데이터 다운로드 – 모델 체크포인트와 정규화 통계는 Hugging Face에 호스팅되어 있습니다. 데이터셋(LIBERO TFDS/RLDS 스위트 또는 RoboTwin Clean)은 헬퍼 스크립트를 통해 가져옵니다.
- 학습 – 예제
torchrun명령어는 논문에서 사용된 정확한 하이퍼파라미터(배치 크기, 최적화 스텝, 워밍업 등)를 보여줍니다. - 평가 – 단일 명령어 스크립트로 어떤 LIBERO 스위트든 또는 모든 50개의 RoboTwin 작업에서 체크포인트를 평가할 수 있습니다.
지원되는 하드웨어 – 주로 소비자용 RTX 4090 GPU에서 테스트되었습니다. TODO 항목에는 향후 Huawei Ascend NPU 지원이 언급되어 있습니다.
라이선스 – Apache 2.0.
인용 – README에는 arXiv 논문(arXiv:2607.27205)용 복사 가능한 BibTeX 항목이 제공됩니다.
결론 – TurboVLA는 로봇 조작을 위한 고속, 저메모리 비전-언어-행동 모델의 구체적이고 오픈소스 구현으로, 학습/평가 스크립트, 환경 설정 안내, 사전 학습된 체크포인트를 모두 포함하고 있습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- Dispatch