H-EmbodVis/TurboVLA
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA – 實時視覺-語言-動作模型
是什麼 – TurboVLA 是一種研究級神經策略,可將原始相機影像 與 自然語言指示直接映射至機器人關節動作。它以輕量級的 V + L → A 架構取代常見的「視覺 → 大型語言模型 → 動作」流程,在 RTX 4090 上實現 32 Hz 推論,同時僅使用 < 1 GB VRAM。
核心理念
- 視覺(DINOv3 ViT‑B/L)與語言(BERT‑base)使用獨立編碼器。
- 基於 GroundingDINO 的雙向視覺-語言互動模組,使兩種模態在無需大型語言模型的情況下交換資訊。
- 緊湊解碼器預測 連續動作區塊(LIBERO 為 12 步,RoboTwin 為 50 步),而非逐步指令,進一步降低延遲。
效能
- LIBERO 基準測試:平均成功率 97.7 %,參數量 0.2 B,延遲 31 ms,VRAM 0.9 GB。
- 性能與更大規模的 VLA 基線相當或更優,且運行成本低得多。
如何開始
- 克隆與設定 – 倉儲提供兩個可選環境:
turbovla-libero用於 LIBERO 模擬套件。turbovla-robotwin用於 RoboTwin 2.0 機器人模擬器。
- 安裝相依性 – 安裝支援 CUDA 的 PyTorch 建構後,使用提供的
pip install -e "[libero]"或"[robotwin]"擴充功能。 - 下載模型與資料 – 模型檢查點與歸一化統計資訊托管於 Hugging Face。資料集(LIBERO TFDS/RLDS 套件或 RoboTwin Clean)透過輔助腳本取得。
- 訓練 – 範例
torchrun命令展示論文中使用的精確超參數(批次大小、最佳化步數、預熱等)。 - 評估 – 單一指令腳本可在任意 LIBERO 套件或全部 50 個 RoboTwin 任務上評估檢查點。
支援硬體 – 主要在消費級 RTX 4090 GPU 上測試。TODO 項目提及未來將支援華為 Ascend NPU。
授權 – Apache 2.0。
引用 – README 提供可直接複製的 arXiv 論文(arXiv:2607.27205)的 BibTeX 項目。
總結 – TurboVLA 是一個具體、開源的快速、低記憶體視覺-語言-動作模型實作,專為機器人操作設計,包含完整的訓練/評估腳本、環境設定說明與預訓練檢查點。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- Dispatch