LeRobot v0.6.0 release notes / what's new
LeRobot v0.6.0 专注于通过集成能够想象未来状态的策略、用于成功检测的奖励模型以及将失败转化为训练数据的部署 CLI,来闭合机器人学习环路。此版本通过六个新的仿真基准测试、深度感知支持以及通过 Hugging Face Jobs 实现的云端训练功能扩展了生态系统。
世界模型与预测策略
LeRobot v0.6.0 引入了三种策略,旨在测试世界模型是否能通过在训练期间学习想象未来状态来提高机器人性能。
VLA-JEPA
基于 Qwen3-VL-2B 构建,VLA-JEPA 使用 JEPA 世界模型根据模型的动作在潜空间中预测未来的帧。世界模型仅在训练期间使用,并在推理时丢弃,从而实现零额外推理成本。预训练的基础检查点(包括一个用于 DROID 的检查点)可在 Hugging Face Hub 上获取。
LingBot-VA
LingBot-VA 是一种自回归视频-动作模型,可以分块预测未来的视频和动作。它结合了真实观测来落地其想象。用户可以通过 --policy.save_predicted_video=true 标志保存机器人的想象展开(rollouts),以便与实际结果进行比较。推理需要具有 24–32 GB VRAM 的 GPU。
FastWAM
FastWAM 在单个网络中结合了约 5B 的视频生成专家和紧凑的动作专家。虽然它在训练期间学习“梦境”展开,但在推理时会跳过此过程以直接对动作块进行去噪。它可以从 lerobot/fastwam_base 检查点进行微调。
扩展的视觉-语言-动作 (VLA) 模型库
此版本显著扩大了支持的 VLA 库:
- GR00T N1.7: NVIDIA 跨具身基础模型的升级版,取代了 N1.5。它利用带有 flow-matching 动作头的 Cosmos-Reason2-2B(基于 Qwen3-VL)。其集成已针对 NVIDIA 原生的 Isaac-GR00T 实现进行了等效性测试。
- MolmoAct2: 来自 Allen Institute for AI 的 VLA。LeRobot 现在支持其全生命周期,包括 LoRA 微调以及在 SO-100/101 机器人上的零样本部署。在 bf16 精度下,推理占用约 12 GB VRAM。
- EO-1: 一种在交错的视觉-文本-动作数据上预训练的 VLA,具有 Qwen2.5-VL-3B 主干网络和 flow-matching 动作头。
- Multitask DiT: 一个约 450M 参数的扩散 Transformer,以 CLIP 视觉和语言嵌入为条件,允许单个模型通过自然语言学习多个任务。
- EVO1: 一个紧凑的 0.77B 参数模型,使用 InternVL3-1B 主干网络和 flow-matching 动作头,专为在普通 GPU 上实时执行而设计。
奖励模型与成功检测
LeRobot v0.6.0 引入了统一的奖励模型 API (lerobot.rewards),以提供成功检测和进度估计。
Robometer
Robometer 是一个基于 Qwen3-VL-4B 构建的通用奖励模型,在超过一百万条机器人轨迹上进行了训练。它可以从原始视频和语言指令中对任务进度和成功率进行评分,而无需进行特定任务的训练。
TOPReward
TOPReward 通过封装现成的 VLM (Qwen3-VL) 并读取给定轨迹和指令下 “True” token 的对数概率,提供零样本奖励估计。
数据集增强与数据加载
数据集流水线的改进侧重于灵活性、丰富性和速度:
- 自定义视频编码:
--dataset.rgb_encoder.*选项允许用户指定编解码器、质量和像素格式。vcodec=auto设置会在回退到 AV1 之前自动探测硬件编码器 (NVENC, VideoToolbox, VAAPI, QSV)。 - 端到端深度支持:LeRobot 现在支持在各种机器人上记录深度图(以毫米为单位捕获并压缩为 12-bit 深度视频流),包括 SO-100/101、Koch 和 Unitree G1。
- VLM 驱动的标注:
lerobot-annotateCLI 使用 VLM(如 Qwen2.5-VL-7B-Instruct)为数据集自动生成带有时间戳的子任务、计划和 VQA 对。 - 性能提升:由于并行多摄像头帧解码和使用紧凑的 uint8 帧,数据加载速度提升了高达 2 倍。加载特定的回合子集已从 275 秒减少到 0.06 秒。
统一评估基准
现在可以通过 lerobot-eval CLI 访问六个新的仿真基准测试,每个基准测试都提供一个 Docker 镜像和一个 SmolVLA 基准线:
- LIBERO-plus: 通过 10,000 个 LIBERO 的扰动变体测试 VLA 的鲁棒性。
- RoboTwin 2.0: 在 SAPIEN 上具有 50 个双臂操作任务,并带有重度领域随机化。
- RoboCasa365: 涵盖 2,500 个程序化生成的厨房中的 365 个厨房任务。
- RoboCerebra: 使用链式子目标评估长程行为。
- RoboMME: 一个测试计数、物体追踪和程序模仿的记忆考试。
- VLABench: 测试操作知识和推理。
训练与部署工作流
lerobot-rollout 与 DAgger
部署现在通过 lerobot-rollout CLI 成为一个专门的工作流。一个关键特性是 DAgger 策略,它允许人类操作员在策略失败时进行干预,使用领导臂记录纠正动作,并将该帧标记为 intervention。这些数据随后用于后续的微调。
可扩展训练
- FSDP 支持:通过 Accelerate 实现的全分片数据并行 (FSDP) 允许训练超过单 GPU 显存的模型。参数、梯度和优化器状态被分片到各个 GPU 上。
- HF Jobs:
lerobot-train命令现在可以使用--job.target标志在云端执行,支持从 T4 到 8x H200 GPU 的硬件。
代码库与生态系统
- 更精简的安装:基础依赖减少了 40%,通过使用功能范围的 extras(例如
[training],[evaluation])来最小化安装占用。 - 可视化:与 Foxglove 集成,允许通过
--display_mode=foxglove进行遥操作和展开流式传输。 - LeLab:一个基于浏览器的 GUI,无需使用 CLI 即可进行校准、记录和训练,目前支持 SO-ARM101。
- Isaac Teleop:与 NVIDIA 的合作,允许通过 Isaac Teleop 栈使用 VR 控制器进行 SO-101 遥操作。