LeRobot v0.5.0 发布说明 / 新功能
LeRobot v0.5.0 是 Hugging Face 机器人库的重大扩展,新增了对人形硬件的支持、更丰富的视觉-语言-动作(VLA)策略,以及在数据记录和训练方面的显著性能提升。本次发布侧重于在硬件、模型和数据流水线方面扩展生态系统。
硬件扩展与人形机器人支持
LeRobot v0.5.0 引入了对 Unitree G1 人形机器人 的全面支持,标志着该库首次集成人形机器人。此支持包括全身控制(WBC),可同时协调行走和操作,并提供用于遥操作和导航的专用接口。
其他硬件新增包括:
- OpenArm & OpenArm Mini:支持 OpenArm 机械臂及其配套遥操作器,包括双手配置。
- Earth Rover:首次将移动机器人集成用于户外导航。
- OMX Robot:新型机械臂,具备校准支持和可配置的夹爪设置。
- CAN Bus Motor Support:集成了基于 CAN 的 RobStride 和 Damiao 电机控制器,支持使用专业级高扭矩执行器。
- SO-100/SO-101:将实现合并到单一代码库,以便更轻松维护双手配置。
新策略与模型库
本次发布新增了六项策略和技术,以提升机器人学习和推理响应能力。
视觉-语言-动作(VLA)模型
- Pi0-FAST:一种使用频域动作序列标记(FAST)的自回归 VLA。它基于 Gemma 300M 的动作专家生成离散化的动作标记。
- Wall-X:基于 Qwen2.5-VL 的 VLA 策略,采用流匹配头实现跨形体机器人控制。
- X-VLA:基于 Florence2 的 VLA,为机器人学习提供了另一种主干网络。
推理与训练增强
- Real-Time Chunking (RTC):一种推理时技术,将新预测与进行中的动作融合。此方法降低延迟,使流匹配策略(如 Pi0 系列、SmolVLA 和 Diffusion)更具响应性。
- SARM(阶段感知奖励建模):针对长时任务的方法,预测任务阶段及该阶段内的进度,而非依赖单一全局线性进度信号。
- PEFT 支持:大型 VLA 现在可以通过策略级配置使用 LoRA 等参数高效微调方法进行微调。
数据集性能与工具
LeRobot v0.5.0 优化了数据流水线,消除记录和训练中的瓶颈。
记录与编码
- Streaming Video Encoding:帧现在在捕获时实时编码,消除录制回合之间的等待时间。此功能包括自动硬件编码器检测以实现 GPU 加速。
- Encoding Speed:并行编码已成为默认设置,使整体编码速度提升 3 倍。
训练与管理
- Training Speed:由于消除了数据访问瓶颈并改进了图像变换支持,图像训练速度提升至原来的 10 倍。
- Dataset Tools:新功能包括用于层次学习的子任务标注、用于存储效率的图像转视频转换,以及用于数据集检查的
info操作。
EnvHub 与仿真集成
EnvHub 允许用户使用 HubEnvConfig 直接从 Hugging Face Hub 加载仿真环境。通过下载并执行远程的 make_env 函数,省去了本地安装包的需求。
此外,此次发布集成了 NVIDIA IsaacLab-Arena,提供基于 NVIDIA Isaac Sim 的 GPU 加速、大规模并行环境实例,以用于强化学习。
代码库现代化
LeRobot v0.5.0 更新了技术基础,以支持现代硬件和软件标准:
- Core Requirements:最低要求更新至 Python 3.12+,并迁移至 Transformers v5。
- Extensibility:支持第三方策略插件,用户可通过
pip将自定义策略注册为可安装包,无需修改核心库。 - Hardware Support:PyTorch 版本范围已更新,以支持 NVIDIA Blackwell GPU。
- Telemetry:远程 Rerun 可视化现已支持压缩图像,以提高带宽使用效率。