2toinf/X-VLA
[ICLR 2026] The offical Implementation of "Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model"
解决的问题
X-VLA 解决了在不同机器人平台(具身)上训练通用视觉-语言-动作(VLA)模型的挑战。它利用异构机器人数据集,构建一个在多种硬件上具有良好泛化能力的模型,从而提升机器人操作任务中的灵巧性和适应性。
工作原理
X-VLA 采用软提示(soft-prompted)的 Transformer 架构。它引入了与具身相关的可学习嵌入(软提示),引导统一的 Transformer 主干网络在多个领域学习策略。为保持一致性,它采用统一的末端执行器6D(EE6D)控制空间,用于本体感觉输入和动作输出。
适用人群
本项目适用于希望在物理机器人或 LeRobot 等仿真平台中部署可扩展、跨平台 VLA 模型的机器人研究人员和开发者。
主要亮点
- 跨具身泛化能力:在六个仿真平台和三台真实机器人上实现最先进性能。
- 服务器-客户端架构:将模型环境与机器人特定依赖分离,避免包冲突,并支持分布式推理。
- 统一控制空间:使用标准化的 EE6D 控制空间,确保不同机械臂之间的一致性。
- 可扩展的训练:支持 LoRA 微调和模块化数据集接口,便于添加自定义机器人演示。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目