LeRobot 社区数据集:构建机器人领域的 ImageNet

泛化作为数据问题

在机器人领域,泛化——即在未见过的环境中使用新颖物体执行任务的能力——主要是一种数据现象,而非模型属性。虽然 VLA 模型可以完成折叠衣物或抓取立方体等任务,但它们适应新环境的能力受到多样化训练数据可用性的限制。

为了实现通用策略,模型必须在异构数据集上共同训练。此过程使模型能够抽象更广泛的模式,理解不仅是如何行动,还包括场景和目标背后的“原因”。当前的进展常常受阻,因为大多数机器人数据来自结构化的学术实验室,缺乏类似 ImageNet 等互联网规模数据集所具备的真实世界多样性。

LeRobot 社区方法

LeRobot 正在通过简化记录流程、降低硬件成本以及简化上传至 Hugging Face Hub 的过程,使机器人数据收集民主化。此举旨在突破孤立实验室的“数据孤岛”,构建全球共享的基础设施。

目前,数据集格局主要由机器人手臂和操作任务主导,尤其是使用 So100 和 Koch 机器人。然而,该倡议已扩展至其他领域,包括:

  • 自动驾驶车辆
  • 辅助机器人
  • 移动导航

值得注意的社区贡献已包括用于精确家庭抽屉操作的数据集、通过立体摄像头捕获的完整棋局,以及与彩色动物模型的交互。

机器人基础模型的数据金字塔

真实世界数据是将抽象先验与落地物理动作对齐的关键“连接组织”。为优化训练,LeRobot 参考了数据金字塔结构(改编自 Gr00t),其中数据量随具身特异性的提升而递减:

  1. 基础层: 大规模网络和视频数据。
  2. 模拟多样性: 合成数据。
  3. 物理执行层: 位于金字塔顶部的真实世界机器人交互。

增加真实世界交互的数量和多样性可以缩小仿真到现实的差距,并在结构上强化金字塔各层之间的联系,从而产生更稳健且更强大的策略。

社区数据策划的挑战

随着社区贡献数据量的增长,Hugging Face 在当前策划流程中识别出四个主要挑战:

  1. 任务标注不一致: 许多数据集的任务描述为空、过于简短(例如 “Up”)或含糊不清,导致认知系统难以理解上下文。
  2. 特征映射不一致: 摄像头视角标记模糊(例如使用 images.laptop 而未指明是第三人称视角还是手腕视角)。
  3. 低质量片段: 由于文件被删除且未重新索引,导致出现帧数极少或序列一致性中断的片段。
  4. 维度不一致: 即使使用相同的机器人硬件(如 So100),动作或状态的维度也可能不同。

高质量机器人数据的最佳实践

为提升社区数据集的实用性,LeRobot 提供了一套标准化的数据收集清单:

图像与视频质量

  • 视角: 最好使用两个高分辨率摄像头视角(至少 480x640 / 720p)。
  • 稳定性: 确保视频拍摄平稳无抖动,并保持中性、稳定的光照。
  • 构图: 主臂不应出现在画面中,只显示从臂及被操作的物体。
  • 背景: 使用静止且不分散注意力的背景。

元数据与命名

  • FPS(帧率): 视频录制约为每秒 30 帧。
  • 命名约定: 使用 <modality>.<location> 格式(例如 images.topimages.wrist.left),避免使用设备特定的名称如 images.phone
  • 机器人类型: 确保在元数据中选择正确的机器人类型,并参考 LeRobot 配置注册表以保持一致性。

任务标注

  • 清晰度: 使用 task 字段清晰描述目标(例如 “Pick the yellow lego block and put it in the box”。)。
  • 长度: 保持描述简洁,通常在 25–50 个字符之间,避免使用诸如 “task1” 的通用标签。

Sources