H-EmbodVis/TurboVLA

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

TurboVLA – 实时视觉-语言-动作模型

是什么 – TurboVLA 是一种研究级神经策略,可将原始摄像头图像 自然语言指令直接映射为机器人关节动作。它用轻量级的 V + L → A 架构替代了通常的“视觉 → 大型语言模型 → 动作”流程,在 RTX 4090 上实现 32 Hz 推理,同时仅使用 < 1 GB VRAM

核心思想

  • 视觉(DINOv3 ViT‑B/L)和语言(BERT‑base)分别使用独立编码器。
  • 基于 GroundingDINO 的双向视觉-语言交互模块,使两种模态在无需大型语言模型的情况下交换信息。
  • 紧凑解码器预测 连续动作块(LIBERO 为 12 步,RoboTwin 为 50 步),而非逐步命令,进一步降低延迟。

性能

  • LIBERO 基准测试:平均成功率 97.7 %,参数量 0.2 B,延迟 31 ms,VRAM 0.9 GB。
  • 在性能上匹配或超过更大的 VLA 基线,同时运行成本低得多。

如何开始

  1. 克隆与设置 – 仓库提供两个可选环境:
    • turbovla-libero 用于 LIBERO 模拟套件。
    • turbovla-robotwin 用于 RoboTwin 2.0 机器人模拟器。
  2. 安装依赖 – 在安装支持 CUDA 的 PyTorch 构建后,使用提供的 pip install -e "[libero]""[robotwin]" 扩展。
  3. 下载模型与数据 – 模型检查点和归一化统计信息托管在 Hugging Face 上。数据集(LIBERO TFDS/RLDS 套件或 RoboTwin Clean)通过辅助脚本获取。
  4. 训练 – 示例 torchrun 命令展示了论文中使用的精确超参数(批量大小、优化器步数、预热等)。
  5. 评估 – 单命令脚本可在任意 LIBERO 套件或全部 50 个 RoboTwin 任务上评估检查点。

支持硬件 – 主要在消费级 RTX 4090 GPU 上测试。TODO 条目提到未来将支持华为 Ascend NPU。

许可证 – Apache 2.0。

引用 – README 提供了可直接复制的 arXiv 论文(arXiv:2607.27205)的 BibTeX 条目。


总结 – TurboVLA 是一个具体、开源的快速、低内存视觉-语言-动作模型实现,专为机器人操作设计,包含完整的训练/评估脚本、环境设置说明和预训练检查点。

相关

  • 项目
  • Dispatch
  • 项目
  • Dispatch
  • Dispatch