LeRobot v0.6.0 发行说明

LeRobot v0.6.0 发行说明

世界模型:能够想象的策略

LeRobot v0.6.0 引入了三种世界模型策略,它们在训练过程中学习预测未来帧,而不会产生额外的推理开销。

VLA-JEPA

VLA-JEPA 教导一个紧凑的 VLA(基于 Qwen3-VL-2B)在潜在空间中预测未来,同时学习行动:在训练过程中,JEPA 世界模型根据模型自身的动作预测即将到来的帧。世界模型在推理时消失,提供零额外推理开销的世界模型监督。Hub 上提供三个可直接使用的检查点,包括用于微调的 DROID 预训练基础:

lerobot-train \
  --policy.path=lerobot/VLA-JEPA-Pretrain \
  --dataset.repo_id=${HF_USER}/my_dataset \
  --policy.repo_id=${HF_USER}/my_finetuned_policy

请参阅 VLA-JEPA 文档论文

LingBot-VA

LingBot-VA 是一种自回归视频-动作模型,它逐块预测未来视频和动作,并将真实观察反馈回来以保持想象的基础。您可以保存机器人想象的内容(--policy.save_predicted_video=true)并将其与实际发生的情况进行比较。推理在单个 24–32 GB GPU 上运行。请参阅 文档论文

FastWAM

FastWAM 将约 5 B 的视频生成专家与紧凑的动作专家结合在单个网络中,使模型实际上学会梦想自己的轨迹。在推理时,它完全跳过梦想阶段,直接去噪动作块。您可以从 lerobot/fastwam_base 进行微调,并参阅 文档 了解更多信息。

VLAs:模型动物园持续扩展

此版本向 LeRobot 动物园添加了五种新的视觉-语言-动作模型,范围从 GR00T N1.7 到紧凑的 EVO1。

GR00T N1.7

我们将 NVIDIA GR00T 集成升级到了 GR00T N1.7,这是 NVIDIA 最新开源的跨具身基础模型。N1.7 将之前的 VLM 替换为 Cosmos‑Reason2‑2B(基于 Qwen3‑VL),并配备一个流匹配动作头;我们的集成经过与 NVIDIA 原始 Isaac‑GR00T 实现的 parity 测试:相同的输入,相同的输出。Flash‑attention 现在是可选的,因此 pip install 'lerobot[groot]' 直接可用,并且您可以直接加载 NVIDIA 发布的检查点

GR00T N1.7 在 LeRobot 中取代了 N1.5。如果您需要 N1.5,请将 lerobot==0.5.1 固定。

MolmoAct2

MolmoAct2,即 Allen Institute for AI 的视觉-语言-动作模型,现在已移植到 LeRobot,并覆盖了完整的生命周期:微调(完整或 LoRA)、评估以及真实机器人部署。带有校准校正的现成检查点意味着您可以在 SO‑100/101 上零射击运行它:

lerobot-rollout \
  --policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \
  --robot.type=so100_follower \
  --robot.port=/dev/ttyACM0 \
  --robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \
  --task="pick up the red cube" --duration=30

推理在 bf16 下大约占用 12 GB,而 LoRA 微调可以在单个 24 GB GPU 上完成。请参阅 MolmoAct2 文档

EO-1

EO‑1 是一种在交错视觉-文本-动作数据上上游预训练的 VLA,现已加入 LeRobot:它具有一个 Qwen2.5‑VL‑3B 骨干网络和一个流匹配动作头,由论文的作者之一贡献。您可以使用标准的 lerobot-train 工作流程通过 --policy.type=eo1 进行训练。详情请参见 文档论文

多任务 DiT

多任务扩散 Transformer 策略将 TRI 大行为模型食谱带入 LeRobot:一个约 450 M 参数的扩散 Transformer,条件于 CLIP 视觉和语言嵌入,使得一个模型可以通过自然语言学习许多任务。它同时支持扩散和流匹配目标,并且足够小以便自行训练。请参阅 文档

EVO1

VLAs 不必庞大。EVO1 将其策略压缩到 0.77 B 参数,采用 InternVL3‑1B 骨干网络和流匹配动作头,足够小以便在 modest GPU 上进行微调和实时运行。它开箱即用地提供两阶段微调和实时分块支持。请参阅 EVO1 文档论文

奖励模型:了解您的机器人何时成功

LeRobot v0.6.0 提供了一个统一的奖励模型 API,附带两个新的预训练模型,它们可以从视频和语言中评分成功和进度,而无需任务特定训练。

Robometer

Robometer 是一个预训练的通用奖励模型:将 lerobot/Robometer-4B 指向任何 LeRobot 数据集,它将从原始视频加上语言指令中评分任务进度和成功,无需任务特定训练。它建立在 Qwen3‑VL‑4B 基础上,并通过在超过一百万条机器人轨迹的数据集上进行轨迹比较进行训练(RSS 2026 论文)。

TOPReward

TOPReward 实现完全零射击:没有任何奖励权重。它封装了一种现成的 VLM(Qwen3‑VL),并读取在给定轨迹视频和任务指令下标记 "True" 的对数概率。任何有能力的 VLM 都可以成为奖励函数。

两者都附带标注脚本,可将每帧进度曲线写入您的数据集,以便用于奖励感知行为克隆(RA‑BC)、数据集质量检查以及进度叠加视频。请查看 RobometerTOPReward 文档。

数据集:更快加载,更丰富数据

数据集处理获得了自定义视频编码、端到端深度、通过 VLM 进行大规模语言标注,以及最高 2× 更快的数据加载。

您的编解码器,您的规则

录制不再受限于一种硬编码的编解码器。新的 --dataset.rgb_encoder.* 选项公开了完整的编码表面(编解码器、质量、像素格式、GOP、预设),而 vcodec=auto 会先探测硬件编解码器如 NVENC、VideoToolbox、VAAPI 和 QSV,然后再回退到默认的软件 AV1 编解码器。对于现有数据集,一条命令即可重新编码所有内容:

lerobot-edit-dataset \
    --repo_id ${HF_USER}/my_dataset \
    --operation.type reencode_videos \
    --operation.rgb_encoder.vcodec h264 \
    --operation.rgb_encoder.crf 23

完整详情请参见 视频编码参数文档

深度支持,端到端

插入 Intel RealSense,将 use_depth: true 设置为 true,LeRobot 将端到端记录深度图:以毫米为单位捕获,作为紧凑的 12‑bit 深度视频流与您的 RGB 相机一起压缩,并在训练时解码回物理单位。深度在录制期间和 lerobot-dataset-viz 中实时渲染,并且适用于 SO‑100/101、Koch、OpenArm、reBot、Unitree G1 等。

大规模语言标注

您的数据集不再是每集一个任务字符串。LeRobot 数据集现在原生存储丰富的语言标注(带时间戳的子任务、计划、记忆、纠正、语音以及每个相机的 VQA 配对),并且新的 lerobot-annotate CLI 会使用观看您的剧集的 VLM 自动填充这些标注:

lerobot-annotate \
    --repo_id=${HF_USER}/my_dataset \
    --new_repo_id=${HF_USER}/my_dataset_annotated \
    --vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \
    --push_to_hub=true

随后,YAML 配方层会在采样时将这些标注渲染为聊天样式的训练消息:正是明天的长距离、会说话的机器人策略将要训练的数据。您可以通过 HF Jobs 进行扩展,并参阅 标注管道文档 了解更多信息。

高达 2× 更快的数据加载

在视频数据集上的训练现在开箱即可达到约 2× 的速度提升:多摄像头帧并行解码,数据加载器工作线程交付紧凑的 uint8 帧(进程间内存减少 4×),并且持续工作线程在 epochs 之间保持解码器缓存。加载大型数据集的子集(episodes=[...])的时间从分钟降至毫秒(在我们的基准测试中从 275 s 降至 0.06 s)。采样现在也是确定的且可恢复的,因此中断的训练可以精确地从样本处重新开始。

基准测试:一个 CLI 评估它们全部

六个新的仿真基准测试加入了评估中心,并且都可以通过单一的 lerobot-eval 命令访问。

  • LIBERO-plus 通过大约 10,000 个 LIBERO 的受扰变体在七个轴上对 VLAs 进行压力测试,从照明和相机视角到重写的指令。它告诉您策略何时会失效。
  • RoboTwin 2.0 在 SAPIEN 上覆盖了 50 个双臂操作任务,伴有大规模领域随机化,并附带 超过 100k 个可直接训练的轨迹 在 Hub 上。
  • RoboCasa365 在移动操作器上覆盖了 365 项厨房任务,分布在 2,500 个程序生成的厨房中,是我们阵容中最大的任务表面。
  • RoboCerebra 通过链接 3 到 6 个子目标的情节在语言基础的中间指令下评估长距离行为,此外还有一个 6,660‑情节数据集。
  • RoboMME 是一项记忆考试:您的策略能否计数重复、跟踪隐藏对象并模仿演示的程序?涵盖 4 个记忆套件中的 16 项任务。
  • VLABench 在操作中测试知识和推理,从物理问题到如端到端冲泡咖啡这样的复合任务。
lerobot-eval \
  --policy.path=lerobot/smolvla_robotwin \
  --env.type=robotwin \
  --env.task=beat_block_hammer \
  --eval.n_episodes=100 --eval.batch_size=1

仿真后端需要特定的系统依赖项,并有各自的安装步骤;每个文档页面都有确切的配方,并且每个基准测试都提供一个现成的 Docker 镜像,如果您希望跳过设置的话。

连同 LIBERO、Meta‑World 和 NVIDIA IsaacLab‑Arena,这就形成了九个基准测试家族,位于同一屋檐下,并且有一个新的 添加新基准测试指南 详细说明了如何插入您自己的基准测试。评估也变得更快:并行评估现在默认为异步向量化环境,基准测试显示最高可达 2× 的速度提升。

训练 & 推理

训练和部署获得了一个专用的 rollout CLI,具备 DAgger‑style 数据收集、用于多 GPU 扩展的 FSDP,以及通过 HF Jobs 进行的云端训练。

lerobot-rollout:部署获得自己的 CLI

部署策略曾经是对 lerobot-record 的一种黑客手段。新的 lerobot-rollout CLI 使部署成为独立的工作流程,具有可插拔的策略和推理后端(包括用于慢速兼容 VLAs 的实时分块)。base 策略仅运行策略。sentry 持续记录,轮换情节并将其上传到 Hub。highlight 保持一个环形缓冲区,并在您按下按键时保存最后 N 秒,以免错过有趣的时刻。episodic 镜像经典的情节/重置录制工作流程。而 dagger 将部署转变为数据收集。

通过 DAgger 策略,您观察策略运行,在它出错的那一刻按下按键(或 USB 脚踏板),切换到您的领导臂以记录纠正,然后将控制权交回。被驱动的领导臂在您接管之前会被驱动到追随者的姿势,以确保交接无抖动。每个纠正帧都会被标记为 intervention 标志,生成的数据集已准备好进行下一次微调:

lerobot-rollout \
    --strategy.type=dagger \
    --policy.path=${HF_USER}/my_policy \
    --robot.type=so100_follower \
    --robot.port=/dev/ttyACM0 \
    --teleop.type=so101_leader \
    --teleop.port=/dev/ttyACM1 \
    --dataset.repo_id=${HF_USER}/dagger_corrections \
    --dataset.single_task="Grasp the block"

部署、收集纠正、微调、重复:机器人学习飞轮现在只是一个 CLI 标志。请阅读 部署文档

FSDP:训练大于您的 GPU 的模型

机器人基础模型正在超越单个 GPU。LeRobot 训练现在通过 Accelerate 支持 FSDP(完全分片数据并行):参数、梯度和优化器状态在 GPU 之间分片,而检查点会被收集回一个普通的单文件 model.safetensors,其加载方式与其他策略相同。您甚至可以在不同数量的 GPU 上恢复 FSDP 运行。请参阅 多 GPU 训练文档

通过 HF Jobs 进行云端训练

没有 GPU?没问题。完全相同的 lerobot-train 命令现在只需添加一个标志即可在云端运行:

lerobot-train \
  --dataset.repo_id=${HF_USER}/so101_test \
  --policy.type=act \
  --policy.repo_id=${HF_USER}/my_policy \
  --job.target=a10g-small

LeRobot 如果需要会将您的本地数据集推送到私有 Hub 仓库,提交作业,将日志流式传输到您的终端,并在最后将训练好的策略推送到 Hub。您可以使用 --job.target 从 T4 到 8× H200 进行选择(计算按使用量付费)。请查看文档

代码库:更精简、更清晰

安装现在更轻量,依赖项进行了特性门控,并且可用性改进包括 Foxglove 流式传输、uv 锁、Wayland 键盘支持以及基于插件的组件。

  • pip install lerobot 现在确实是轻量级的,基础依赖项减少了大约 40%。特性范围的额外项([training][core_scripts][evaluation],...)覆盖了剩余部分,并且缺失依赖项的错误会告诉您确切需要添加哪个额外项。如果您仅使用 LeRobot 数据集,则不再需要安装与硬件相关的依赖项 :)
  • 支持的 PyTorch 移至 2.7–2.11,并随 Linux uv 安装预先锁定 CUDA 12.8 轮子。--policy.dtype=bfloat16 现在通过 Accelerate 推动真实的混合精度训练。
  • 一份提交的 uv.lock 是 CI、Docker 和开发的权威依赖规范,文档中包含了每一步的 uv 安装路线,直至通过单个标志选择您的 CUDA 轮子。
  • --display_mode=foxglove 将遥测操作、录制和推出流式传输到 Foxglove,这是机器人世界中许多已使用的可视化工具。它适用于远程设置,并且 lerobot-dataset-viz 获得可刷洗的数据集播放。
  • 可通过 pip 安装的 lerobot_env_* 包现在会自行注册它们的环境。插件系统覆盖了所有五种组件类型:机器人、相机、遥测操作器、策略和环境。
  • 在 Wayland、SSH、无头装置以及 macOS(无需无障碍权限)上的录制期间键盘控制现在可以正常工作。

请查看 发行说明 获取完整列表以及关于破坏性更改的迁移指南。

社区 & 生态系统

新工具如 LeLab 浏览器 UI、Isaac Teleop 集成、硬件指南和插件策略指南扩展了可访问性。

  • LeLab 将完整的 LeRobot 工作流程(校准、遥测操作、记录、在本地或 HF Jobs 上训练、部署)放置在一个浏览器 UI 中,无需 CLI。它目前支持 SO‑ARM101。立即尝试!
  • Isaac Teleop 允许您通过 NVIDIA 的 Isaac Teleop 堆栈 使用 VR 控制器在 CloudXR/OpenXR 上远程遥操作 SO‑101,这是与 NVIDIA 团队合作的成果。请参阅 文档
  • 新的 计算硬件指南 回答了每个新来者都会问的两个问题:我需要哪种 GPU,以及训练需要多长时间?它提供了每个策略系列的测量 VRAM 范围,并给出了从 RTX 4090 到 4× H100 的参考训练时间。
  • 重写的 添加策略指南 展示了如何将您自己的策略作为树内代码或插件包发送,无需 PR。

最后的想法

除了头条功能之外,v0.6.0 还包括数百个错误修复、文档改进以及代码库各处的生活质量提升,从更智能的默认设置到更可靠的 CI。

我们想向社区中的每一个人致以巨大的感谢。此版本包括来自学术界、工业界和爱好者团队的工作,他们选择 LeRobot 作为其模型和基准测试的家园。每个 PR 和错误报告都推动开源机器人技术向前发展。

敬请期待更多内容 🤗 开始使用 这里! – LeRobot 团队 ❤️

Sources