Robbyant/lingbot-vla-v2
From Foundation to Application
解决的问题
LingBot-VLA 2.0 是一个为弥合大规模预训练与可靠现实世界机器人应用之间差距而设计的视觉-语言-动作(VLA)基础模型。它解决了在不同机器人类型(身体形态)和任务之间实现泛化,同时在仿真和真实世界环境中保持高性能的挑战。
工作原理
该模型使用了一个包含 60,000 小时数据的大规模预训练语料库,其中包括 50,000 小时的机器人轨迹和 10,000 小时的自我中心人类视频。它采用了多项关键技术革新:
- 统一的动作表示:将多种机器人配置映射到一个 55 维的标准状态/动作向量中,涵盖手臂、末端执行器、夹爪、灵巧手、腰部、头部和移动基座。
- MoE 动作专家:在动作专家中使用稀疏的专家混合(MoE)层,使通用先验知识与特定身体形态/任务模式共存。
- 双查询蒸馏:从 LingBot-Depth 和 DINO-Video 中蒸馏感知查询,以捕捉当前场景的几何结构和未来场景的演化(预测动力学建模)。
适用对象
本项目适用于希望部署可在多种硬件配置上运行并执行复杂操作任务的通用机器人策略的机器人研究人员和开发者。
主要亮点
- 广泛泛化:在涵盖 20 种不同机器人配置的大规模数据集上进行训练。
- 扩展的动作空间:支持超出标准双臂操作的广泛机器人组件。
- 高性能:在 GM-100 双臂操作和长时程移动操作基准测试中,优于以往版本及竞争对手。
- 真实世界就绪:包含用于仿真(RoboTwin)和真实世界机器人的部署脚本,使用 RTX 4090D 推理时间约为 130ms。
相关
- 项目
- 项目
- 项目
- 项目
- 项目