LeRobot v0.5.0 发布说明 / 新功能

LeRobot v0.5.0 是 Hugging Face 机器人库的重大扩展,新增了对人形硬件的支持、更丰富的视觉-语言-动作(VLA)策略,以及在数据记录和训练方面的显著性能提升。本次发布侧重于在硬件、模型和数据流水线方面扩展生态系统。

硬件扩展与人形机器人支持

LeRobot v0.5.0 引入了对 Unitree G1 人形机器人 的全面支持,标志着该库首次集成人形机器人。此支持包括全身控制(WBC),可同时协调行走和操作,并提供用于遥操作和导航的专用接口。

其他硬件新增包括:

  • OpenArm & OpenArm Mini:支持 OpenArm 机械臂及其配套遥操作器,包括双手配置。
  • Earth Rover:首次将移动机器人集成用于户外导航。
  • OMX Robot:新型机械臂,具备校准支持和可配置的夹爪设置。
  • CAN Bus Motor Support:集成了基于 CAN 的 RobStride 和 Damiao 电机控制器,支持使用专业级高扭矩执行器。
  • SO-100/SO-101:将实现合并到单一代码库,以便更轻松维护双手配置。

新策略与模型库

本次发布新增了六项策略和技术,以提升机器人学习和推理响应能力。

视觉-语言-动作(VLA)模型

  • Pi0-FAST:一种使用频域动作序列标记(FAST)的自回归 VLA。它基于 Gemma 300M 的动作专家生成离散化的动作标记。
  • Wall-X:基于 Qwen2.5-VL 的 VLA 策略,采用流匹配头实现跨形体机器人控制。
  • X-VLA:基于 Florence2 的 VLA,为机器人学习提供了另一种主干网络。

推理与训练增强

  • Real-Time Chunking (RTC):一种推理时技术,将新预测与进行中的动作融合。此方法降低延迟,使流匹配策略(如 Pi0 系列、SmolVLA 和 Diffusion)更具响应性。
  • SARM(阶段感知奖励建模):针对长时任务的方法,预测任务阶段及该阶段内的进度,而非依赖单一全局线性进度信号。
  • PEFT 支持:大型 VLA 现在可以通过策略级配置使用 LoRA 等参数高效微调方法进行微调。

数据集性能与工具

LeRobot v0.5.0 优化了数据流水线,消除记录和训练中的瓶颈。

记录与编码

  • Streaming Video Encoding:帧现在在捕获时实时编码,消除录制回合之间的等待时间。此功能包括自动硬件编码器检测以实现 GPU 加速。
  • Encoding Speed:并行编码已成为默认设置,使整体编码速度提升 3 倍。

训练与管理

  • Training Speed:由于消除了数据访问瓶颈并改进了图像变换支持,图像训练速度提升至原来的 10 倍。
  • Dataset Tools:新功能包括用于层次学习的子任务标注、用于存储效率的图像转视频转换,以及用于数据集检查的 info 操作。

EnvHub 与仿真集成

EnvHub 允许用户使用 HubEnvConfig 直接从 Hugging Face Hub 加载仿真环境。通过下载并执行远程的 make_env 函数,省去了本地安装包的需求。

此外,此次发布集成了 NVIDIA IsaacLab-Arena,提供基于 NVIDIA Isaac Sim 的 GPU 加速、大规模并行环境实例,以用于强化学习。

代码库现代化

LeRobot v0.5.0 更新了技术基础,以支持现代硬件和软件标准:

  • Core Requirements:最低要求更新至 Python 3.12+,并迁移至 Transformers v5。
  • Extensibility:支持第三方策略插件,用户可通过 pip 将自定义策略注册为可安装包,无需修改核心库。
  • Hardware Support:PyTorch 版本范围已更新,以支持 NVIDIA Blackwell GPU。
  • Telemetry:远程 Rerun 可视化现已支持压缩图像,以提高带宽使用效率。

Sources