LeRobot v0.4.0 发布说明 / 新功能

LeRobot v0.4.0 是面向开源机器人工具库的重大更新,旨在提升机器人学习的可扩展性、灵活性和可访问性。此次发布引入了全新的数据集基础设施、高容量的视觉‑语言‑动作(VLA)模型,以及用于硬件集成的模块化插件系统。

可扩展的数据基础设施(Datasets v3.0)

LeRobot v0.4.0 引入了 LeRobotDataset v3.0,彻底改造了数据集基础设施,以支持大规模、海量的机器人学习。该版本专为处理超过 400GB 的数据集而设计,例如 Open X Embodiment(OXE)和 Droid。

v3.0 的关键增强

  • Chunked Episode Format:支持在 OXE 级别处理大规模数据集。
  • Streaming Capabilities:提供更快的加载时间和视频数据的无缝流式传输。
  • Unified Parquet Metadata:用结构化的 Parquet 文件取代分散的 JSON 文件,以简化元数据管理。
  • Performance Gains:降低数据集初始化时间并提升内存效率。

数据集编辑工具

全新的 lerobot-edit-dataset CLI 允许用户通过以下操作来整理和优化数据集:

  • 删除特定的 episode。
  • 按比例或 episode 索引拆分数据集。
  • 添加或移除特征。
  • 将多个数据集合并为一个统一的数据集。

扩展的仿真环境

LeRobot 现在提供更广泛的仿真基准支持,以促进机器人策略的训练和评估。

  • LIBERO 支持:集成 LIBERO,这是一个包含 130 多个任务的开放 VLA 策略基准,建立统一的 VLA 评估环境。
  • Meta-World 集成:集成 Meta-World,这是一个包含 50 多个任务的多任务操作基准。通过标准化使用 gymnasium ≥ 1.0.0mujoco ≥ 3.0.0 来确保确定性随机种子。

代码库与训练优化

模块化数据处理流水线

为弥合原始传感器数据与模型需求之间的差距,LeRobot v0.4.0 引入了 Processors。该模块化流水线系统使用 ProcessorStep 组件来处理归一化、分词和设备迁移等任务。

提供了两种专用的流水线类型:

  • PolicyProcessorPipeline:针对高性能训练和推理中使用的批量张量进行优化。
  • RobotProcessorPipeline:为使用单个数据点的实时机器人控制而设计。

多 GPU 训练

训练现已集成 Hugging Face Accelerate,用户可以通过单个命令在多 GPU 上扩展实验。训练时间会随 GPU 数量成比例缩短(例如使用 2 块 GPU 可将时间减半)。

开放世界泛化策略

LeRobot v0.4.0 集成了多种最先进的基础模型,以提升机器人在多样环境中的推理和泛化能力。

PI0 与 PI0.5

由 Physical Intelligence 开发,这些 VLA 模型旨在实现开放世界的泛化。PI0.5 尤其以通过在多模态网页数据、口头指令和多环境机器人数据的混合上共同训练,从而适应新环境的能力而著称。

GR00T N1.5

通过与 NVIDIA 的合作集成,GR00T N1.5 是一种跨形体的基础模型。它利用多模态输入(语言和图像)执行复杂的操作任务,训练数据包括真实类人数据、来自 NVIDIA Isaac GR00T Blueprint 的合成数据以及互联网规模的视频数据。

硬件集成与插件系统

LeRobot 引入了插件系统,允许通过 pip install 将第三方硬件集成进来,而无需修改核心库。该系统提升了可扩展性并防止核心库膨胀。

新的硬件集成

  • Reachy 2:支持来自 Pollen Robotics 的 Reachy 2,适用于真实控制和仿真。
  • Mobile Teleoperation:借助新流水线系统,用户现在可以通过 iOS 或 Android 设备遥控从属机械臂,RobotProcessor 负责必要的动作空间转换。

教育资源

Hugging Face 推出了开源的 Robot Learning CourseModern Robot Learning Tutorial。课程涵盖经典机器人学、用于模仿学习的生成模型(VAE、扩散)以及强化学习。教程提供了动手实践、基于第一原理的现代技术方法,并附有可直接使用的代码示例。

Sources