XiaomiRobotics/Xiaomi-Robotics-1
Code for Xiaomi-Robotics-1
解决的问题
Xiaomi-Robotics-1 (XR-1) 解决了机器人领域的“数据障碍”——即限制策略模型扩展的高质量、人工标注机器人数据的匮乏问题。它使机器人能够在未见过的环境中执行移动操作,并利用极少的演示数据适应新的复杂任务。
工作原理
XR-1 是一种 Vision-Language-Action (VLA) 模型,它使用 Mixture-of-Transformers (MoT) 架构将预训练的 Vision-Language Model (Qwen3-VL) 与 Diffusion-Transformer (DiT) 相结合。它采用两阶段训练过程:
- 预训练:在超过 100,000 小时的“embodiment-free”轨迹上训练模型。自动标注流水线对这些轨迹进行分段并生成状态转换描述,使模型在不需要特定机器人硬件数据的情况下学习通用的动作生成。
- 后训练:使用跨具身数据(真实机器人和开源数据)对模型进行对齐,将通用能力映射到特定的机器人硬件,并将模型与自然语言指令对齐。
适用对象
该项目专为构建移动操作基础模型的机器人研究人员和开发人员,以及寻求部署可在不同环境和任务中泛化的通用机器人策略的人士而设计。
亮点
- 大规模:在超过 1,700 个场景的 10 万小时以上真实世界操作轨迹上进行了预训练。
- SOTA 性能:在 RoboCasa365 和 RoboDojo 排行榜上排名第一。
- 数据效率:每个任务仅需几小时的演示即可学习新的复杂任务。
- 实时优化:采用异步执行以降低推理延迟,并针对消费级 GPU 进行了优化。
相关
- Dispatch
- 项目
- 项目
- Dispatch
- 项目