H-EmbodVis/TurboVLA
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
TurboVLA – 实时视觉-语言-动作模型
是什么 – TurboVLA 是一种研究级神经策略,可将原始摄像头图像 和 自然语言指令直接映射为机器人关节动作。它用轻量级的 V + L → A 架构替代了通常的“视觉 → 大型语言模型 → 动作”流程,在 RTX 4090 上实现 32 Hz 推理,同时仅使用 < 1 GB VRAM。
核心思想
- 视觉(DINOv3 ViT‑B/L)和语言(BERT‑base)分别使用独立编码器。
- 基于 GroundingDINO 的双向视觉-语言交互模块,使两种模态在无需大型语言模型的情况下交换信息。
- 紧凑解码器预测 连续动作块(LIBERO 为 12 步,RoboTwin 为 50 步),而非逐步命令,进一步降低延迟。
性能
- LIBERO 基准测试:平均成功率 97.7 %,参数量 0.2 B,延迟 31 ms,VRAM 0.9 GB。
- 在性能上匹配或超过更大的 VLA 基线,同时运行成本低得多。
如何开始
- 克隆与设置 – 仓库提供两个可选环境:
turbovla-libero用于 LIBERO 模拟套件。turbovla-robotwin用于 RoboTwin 2.0 机器人模拟器。
- 安装依赖 – 在安装支持 CUDA 的 PyTorch 构建后,使用提供的
pip install -e "[libero]"或"[robotwin]"扩展。 - 下载模型与数据 – 模型检查点和归一化统计信息托管在 Hugging Face 上。数据集(LIBERO TFDS/RLDS 套件或 RoboTwin Clean)通过辅助脚本获取。
- 训练 – 示例
torchrun命令展示了论文中使用的精确超参数(批量大小、优化器步数、预热等)。 - 评估 – 单命令脚本可在任意 LIBERO 套件或全部 50 个 RoboTwin 任务上评估检查点。
支持硬件 – 主要在消费级 RTX 4090 GPU 上测试。TODO 条目提到未来将支持华为 Ascend NPU。
许可证 – Apache 2.0。
引用 – README 提供了可直接复制的 arXiv 论文(arXiv:2607.27205)的 BibTeX 条目。
总结 – TurboVLA 是一个具体、开源的快速、低内存视觉-语言-动作模型实现,专为机器人操作设计,包含完整的训练/评估脚本、环境设置说明和预训练检查点。
相关
- 项目
- Dispatch
- 项目
- Dispatch
- Dispatch