H-EmbodVis/TurboVLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA – 실시간 비전-언어-행동 모델

무엇인가요 – TurboVLA는 원시 카메라 이미지와 자연어 지시를 직접 로봇 관절 동작으로 매핑하는 연구용 신경 정책입니다. 일반적인 "비전 → 대규모 언어 모델 → 행동" 파이프라인을 가벼운 V + L → A 아키텍처로 대체하여, RTX 4090에서 32 Hz의 추론을 달성하면서 1 GB 미만의 VRAM을 사용합니다.

핵심 아이디어

  • 비전(DINOv3 ViT‑B/L)과 언어(BERT‑base)를 위한 별도의 인코더.
  • GroundingDINO 기반의 양방향 비전-언어 상호작용 모듈을 통해 대규모 LLM 없이 두 모달리티 간 정보 교환을 가능하게 합니다.
  • 연속적인 행동 청크(12단계(LIBERO), 50단계(RoboTwin))를 예측하는 컴팩트한 디코더로 지연 시간을 추가로 줄입니다.

성능

  • LIBERO 벤치마크: 평균 성공률 97.7 %, 파라미터 수 0.2 B, 지연 시간 31 ms, VRAM 0.9 GB.
  • 더 큰 VLA 기준 모델과 동등하거나 이를 초과하면서도 실행 비용은 훨씬 낮습니다.

시작 방법

  1. 클론 및 설정 – 리포지토리는 두 가지 선택적 환경을 제공합니다:
    • turbovla-libero: LIBERO 시뮬레이션 스위트용.
    • turbovla-robotwin: RoboTwin 2.0 로봇 시뮬레이터용.
  2. 의존성 설치 – CUDA 호환 PyTorch 빌드를 설치한 후, pip install -e "[libero]" 또는 "[robotwin]" 확장 기능을 사용합니다.
  3. 모델 및 데이터 다운로드 – 모델 체크포인트와 정규화 통계는 Hugging Face에 호스팅되어 있습니다. 데이터셋(LIBERO TFDS/RLDS 스위트 또는 RoboTwin Clean)은 헬퍼 스크립트를 통해 가져옵니다.
  4. 학습 – 예제 torchrun 명령어는 논문에서 사용된 정확한 하이퍼파라미터(배치 크기, 최적화 스텝, 워밍업 등)를 보여줍니다.
  5. 평가 – 단일 명령어 스크립트로 어떤 LIBERO 스위트든 또는 모든 50개의 RoboTwin 작업에서 체크포인트를 평가할 수 있습니다.

지원되는 하드웨어 – 주로 소비자용 RTX 4090 GPU에서 테스트되었습니다. TODO 항목에는 향후 Huawei Ascend NPU 지원이 언급되어 있습니다.

라이선스 – Apache 2.0.

인용 – README에는 arXiv 논문(arXiv:2607.27205)용 복사 가능한 BibTeX 항목이 제공됩니다.


결론 – TurboVLA는 로봇 조작을 위한 고속, 저메모리 비전-언어-행동 모델의 구체적이고 오픈소스 구현으로, 학습/평가 스크립트, 환경 설정 안내, 사전 학습된 체크포인트를 모두 포함하고 있습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch
  • Dispatch