Robbyant/lingbot-vla
A Pragmatic VLA Foundation Model
解决的问题
LingBot-VLA 是一种 Vision-Language-Action (VLA) 基础模型,旨在为机器人控制提供一种实用且高性能的方法。它解决了创建能够在不同机器人配置之间泛化,并在模拟和真实世界环境中均能以高成功率执行任务的模型的挑战。
工作原理
该模型基于来自九种不同双臂机器人配置的 20,000 小时真实世界数据的海量数据集进行预训练。它有两个版本:标准版本和结合了深度信息以提高性能的深度蒸馏 (depth-distilled) 版本。代码库针对训练效率进行了优化,比现有的 VLA 代码库提速 1.5 倍至 2.8 倍,并降低了 GPU 内存占用。
适用对象
本项目面向希望在实体机器人或模拟环境(如 RoboTwin 2.0)中部署 VLA 模型的机器人研究人员和开发人员,以及正在寻找用于自定义机器人数据的高效训练后流水线的人士。
亮点
- 大规模预训练:在跨 9 种机器人配置的 20,000 小时数据上进行训练。
- 高效率:显著提升训练速度并降低 GPU 内存消耗。
- 深度感知选项:提供无深度和深度蒸馏的模型检查点。
- 强大的基准测试:在 GM-100 和 RoboTwin 2.0 基准测试中达到最先进水平。
- LeRobot 集成:与 LeRobot v3.0 完全兼容,用于数据处理和部署。
相关
- 项目
- 项目
- 项目
- 项目
- 项目