H-EmbodVis/TurboVLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA – 實時視覺-語言-動作模型

是什麼 – TurboVLA 是一種研究級神經策略,可將原始相機影像 自然語言指示直接映射至機器人關節動作。它以輕量級的 V + L → A 架構取代常見的「視覺 → 大型語言模型 → 動作」流程,在 RTX 4090 上實現 32 Hz 推論,同時僅使用 < 1 GB VRAM

核心理念

  • 視覺(DINOv3 ViT‑B/L)與語言(BERT‑base)使用獨立編碼器。
  • 基於 GroundingDINO 的雙向視覺-語言互動模組,使兩種模態在無需大型語言模型的情況下交換資訊。
  • 緊湊解碼器預測 連續動作區塊(LIBERO 為 12 步,RoboTwin 為 50 步),而非逐步指令,進一步降低延遲。

效能

  • LIBERO 基準測試:平均成功率 97.7 %,參數量 0.2 B,延遲 31 ms,VRAM 0.9 GB。
  • 性能與更大規模的 VLA 基線相當或更優,且運行成本低得多。

如何開始

  1. 克隆與設定 – 倉儲提供兩個可選環境:
    • turbovla-libero 用於 LIBERO 模擬套件。
    • turbovla-robotwin 用於 RoboTwin 2.0 機器人模擬器。
  2. 安裝相依性 – 安裝支援 CUDA 的 PyTorch 建構後,使用提供的 pip install -e "[libero]""[robotwin]" 擴充功能。
  3. 下載模型與資料 – 模型檢查點與歸一化統計資訊托管於 Hugging Face。資料集(LIBERO TFDS/RLDS 套件或 RoboTwin Clean)透過輔助腳本取得。
  4. 訓練 – 範例 torchrun 命令展示論文中使用的精確超參數(批次大小、最佳化步數、預熱等)。
  5. 評估 – 單一指令腳本可在任意 LIBERO 套件或全部 50 個 RoboTwin 任務上評估檢查點。

支援硬體 – 主要在消費級 RTX 4090 GPU 上測試。TODO 項目提及未來將支援華為 Ascend NPU。

授權 – Apache 2.0。

引用 – README 提供可直接複製的 arXiv 論文(arXiv:2607.27205)的 BibTeX 項目。


總結 – TurboVLA 是一個具體、開源的快速、低記憶體視覺-語言-動作模型實作,專為機器人操作設計,包含完整的訓練/評估腳本、環境設定說明與預訓練檢查點。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • Dispatch