Xiaomi-Robotics-1: 通过 100,000 小时数据扩展视觉-语言-动作模型

Xiaomi-Robotics-1: 通过 100,000 小时数据扩展视觉-语言-动作模型

Xiaomi-Robotics-1 是一款机器人基础模型,旨在通过使用两阶段训练过程来克服高质量机器人数据的稀缺性:大规模的“无具身”预训练,随后进行具身与指令对齐。这种方法允许模型随着数据量和模型规模的可预测地扩展,从而在现实世界的移动操作任务和仿真基准测试中提高成功率。

打破机器人数据瓶颈

机器人技术在历史上一直难以扩展策略模型,因为高质量、真实的机器人数据难以收集且成本高昂。Xiaomi-Robotics-1 通过利用“无具身” (UMI) 预训练解决了这一问题。

使用 UMI 数据进行预训练

在预训练阶段,Xiaomi 使用了跨越超过 1,700 个场景(包括家庭、商业、工业和户外空间)的 100,000 小时 无具身轨迹数据。为了处理这种规模的数据,他们开发了一个由视觉语言模型 (VLM) 驱动的自动标注流水线,该流水线将轨迹划分为固定长度的分段,并使用场景状态转换的语言描述进行标注。

后训练与对齐

在预训练之后,模型会经历一个后训练阶段,以将其通用的动作生成能力与特定的机器人硬件和人类指令对齐。这种对齐发生在两个维度上:

  1. 具身对齐:使用高质量的跨具身真实机器人数据,将通用的动作生成能力映射到实际的物理机器人上,其中包括来自真实家庭的超过 7,200 小时 的内部数据(例如,整理沙发、整理鞋柜)。
  2. 指令对齐:使模型从基于状态转换描述生成动作,转变为直接执行自然语言指令。

机器人技术中的扩展定律

Xiaomi-Robotics-1 表明机器人基础模型表现出清晰的扩展行为。随着预训练数据量和模型规模的增加,验证动作误差降低,且在未见环境中的真实机器人成功率稳步且可预测地提高。

根据资料显示,扩展收益没有表现出饱和迹象,这意味着更强大的预训练模型在经过后训练后,始终能产生更好的真实机器人性能。

性能与应用

Xiaomi-Robotics-1 可作为一个基础模型,能够以极少的真实机器人演示来高效地适应新任务、复杂的任务。

高效的任务适应

在每个任务平均演示时间少于 10 小时的情况下,该模型在电话包装、打印机加墨、洗衣机装载等任务中实现了 75% 的整体成功率。这几乎是 $\pi 0.5$ 基准线 (40%) 的两倍。当预算增加到每个任务少于 40 小时时,整体成功率上升到 85%。

任务 <10 h/task (XR-1) <10 h/task ($\pi 0.5$) <40 h/task (XR-1) <40 h/task ($\pi 0.5$)
电话包装 70% 30% 80% 40%
打印机加墨 70% 20% 60% 20%
洗衣机装载 80% 40% 80% 50%
箱子包装 80% 70% 100% 100%
整体 75% 40% 85% 53%

仿真基准测试

Xiaomi-Robotics-1 在四个强调泛化能力的的主流仿真基准测试中取得了最先进 (SOTA) 的结果:

| 基准测试 | XR-1 成功率 | 第二名 | 相对收益 | | :--- | :--- | :--- | :--- | :--- | | RoboCasa | 74.5% | 72.6% | +2.6% | | RoboCasa365 | 57.4% | 46.6% | +23.2% | | VLABench | 59.1% | 53.2% | +11.1% | | RoboDojo | 13.93% | 8.80% | +58.3% |

社区洞察与技术讨论

Hacker News 上的技术观察者讨论了视频演示中展示的任务复杂度,指出该模型同时处理了几个历史上难以解决的机器人问题:

"Coordinating two hands - Mobile body - Deformable objects - Thin affordances (bag zip in particular) - Multi-object single grasp... a host of things that had individually been tackled as either perception or manipulation problems."

其他用户对家务辅助机器人的未来表示乐观,而一些人对模型的可用性和权重是否公开表示了疑问。一位用户指出,虽然 XiaomiRobotics-0 的资源是可用的,但 Xiaomi-Robotics-1 模型和数据集尚未出现在 GitHub 或 Hugging Face 仓库中。

结论

Xiaomi-Robotics-1 证明了大规模的“无具身”预训练是扩展机器人基础模型的可行路径。通过打破数据瓶 table 瓶颈并将通用能力映射到物理机器人上,Xiaomi 已创建了一个能够很好地泛化到未见环境并以高数据效率适应新任务的模型。

Sources