LeRobot v0.4.0 发布说明 / 新功能
LeRobot v0.4.0 是面向开源机器人工具库的重大更新,旨在提升机器人学习的可扩展性、灵活性和可访问性。此次发布引入了全新的数据集基础设施、高容量的视觉‑语言‑动作(VLA)模型,以及用于硬件集成的模块化插件系统。
可扩展的数据基础设施(Datasets v3.0)
LeRobot v0.4.0 引入了 LeRobotDataset v3.0,彻底改造了数据集基础设施,以支持大规模、海量的机器人学习。该版本专为处理超过 400GB 的数据集而设计,例如 Open X Embodiment(OXE)和 Droid。
v3.0 的关键增强
- Chunked Episode Format:支持在 OXE 级别处理大规模数据集。
- Streaming Capabilities:提供更快的加载时间和视频数据的无缝流式传输。
- Unified Parquet Metadata:用结构化的 Parquet 文件取代分散的 JSON 文件,以简化元数据管理。
- Performance Gains:降低数据集初始化时间并提升内存效率。
数据集编辑工具
全新的 lerobot-edit-dataset CLI 允许用户通过以下操作来整理和优化数据集:
- 删除特定的 episode。
- 按比例或 episode 索引拆分数据集。
- 添加或移除特征。
- 将多个数据集合并为一个统一的数据集。
扩展的仿真环境
LeRobot 现在提供更广泛的仿真基准支持,以促进机器人策略的训练和评估。
- LIBERO 支持:集成 LIBERO,这是一个包含 130 多个任务的开放 VLA 策略基准,建立统一的 VLA 评估环境。
- Meta-World 集成:集成 Meta-World,这是一个包含 50 多个任务的多任务操作基准。通过标准化使用
gymnasium ≥ 1.0.0和mujoco ≥ 3.0.0来确保确定性随机种子。
代码库与训练优化
模块化数据处理流水线
为弥合原始传感器数据与模型需求之间的差距,LeRobot v0.4.0 引入了 Processors。该模块化流水线系统使用 ProcessorStep 组件来处理归一化、分词和设备迁移等任务。
提供了两种专用的流水线类型:
PolicyProcessorPipeline:针对高性能训练和推理中使用的批量张量进行优化。RobotProcessorPipeline:为使用单个数据点的实时机器人控制而设计。
多 GPU 训练
训练现已集成 Hugging Face Accelerate,用户可以通过单个命令在多 GPU 上扩展实验。训练时间会随 GPU 数量成比例缩短(例如使用 2 块 GPU 可将时间减半)。
开放世界泛化策略
LeRobot v0.4.0 集成了多种最先进的基础模型,以提升机器人在多样环境中的推理和泛化能力。
PI0 与 PI0.5
由 Physical Intelligence 开发,这些 VLA 模型旨在实现开放世界的泛化。PI0.5 尤其以通过在多模态网页数据、口头指令和多环境机器人数据的混合上共同训练,从而适应新环境的能力而著称。
GR00T N1.5
通过与 NVIDIA 的合作集成,GR00T N1.5 是一种跨形体的基础模型。它利用多模态输入(语言和图像)执行复杂的操作任务,训练数据包括真实类人数据、来自 NVIDIA Isaac GR00T Blueprint 的合成数据以及互联网规模的视频数据。
硬件集成与插件系统
LeRobot 引入了插件系统,允许通过 pip install 将第三方硬件集成进来,而无需修改核心库。该系统提升了可扩展性并防止核心库膨胀。
新的硬件集成
- Reachy 2:支持来自 Pollen Robotics 的 Reachy 2,适用于真实控制和仿真。
- Mobile Teleoperation:借助新流水线系统,用户现在可以通过 iOS 或 Android 设备遥控从属机械臂,
RobotProcessor负责必要的动作空间转换。
教育资源
Hugging Face 推出了开源的 Robot Learning Course 与 Modern Robot Learning Tutorial。课程涵盖经典机器人学、用于模仿学习的生成模型(VAE、扩散)以及强化学习。教程提供了动手实践、基于第一原理的现代技术方法,并附有可直接使用的代码示例。