LeRobot v0.6.0 發佈說明
LeRobot v0.6.0 發佈說明
世界模型:具備想像能力的策略
LeRobot v0.6.0 引入了三種世界模型策略,它們在訓練期間學習預測未來幀,且不會增加額外的推理成本。
VLA-JEPA
VLA-JEPA 教導一個緊湊的 VLA(基於 Qwen3-VL-2B 構建)在學習動作的同時,在潛在空間中預測未來:在訓練期間,JEPA 世界模型會根據模型自身的動作預測即將出現的幀。世界模型在推理時會消失,從而在零額外推理成本的情況下提供世界模型監督。Hub 上提供了三個即插即用的檢查點,包括一個用於微調的 DROID 預訓練基礎模型:
lerobot-train \n --policy.path=lerobot/VLA-JEPA-Pretrain \n --dataset.repo_id=${HF_USER}/my_dataset \n --policy.repo_id=${HF_USER}/my_finetuned_policy
請參閱 VLA-JEPA 文檔 和 論文。
LingBot-VA
LingBot-VA 是一種自回歸影片-動作模型,它逐塊預測未來的影片和動作,並將真實觀察結果回饋進去以保持其想像的落地。您可以儲存機器人想像的內容 (--policy.save_predicted_video=true) 並將其與實際發生的情況進行比較。推理可在單個 24–32 GB GPU 上運行。請參閱 文檔 和 論文。
FastWAM
FastWAM 在單個網絡中將約 5B 的影片生成專家與緊湊的動作專家配對,因此模型實際上是在學習夢想自己的展開過程。在推理時,它會完全跳過夢想過程,直接對動作塊進行去噪。您可以從 lerobot/fastwam_base 開始進行微調,並在 文檔 中閱讀更多內容。
VLAs:模型庫持續擴大
本次發佈為 LeRobot 模型庫增加了五個新的視覺-語言-動作模型,範圍從 GR00T N1.7 到緊湊的 EVO1。
GR00T N1.7
我們將 NVIDIA GR00T 整合升級到了 GR00T N1.7,這是 NVIDIA 最新一代的跨具身基礎模型。N1.7 使用 Cosmos-Reason2-2B(基於 Qwen3-VL 構建)取代了之前的 VLM,並餵入 flow-matching 動作頭,我們的整合已通過與 NVIDIA 原生 Isaac-GR00T 實現的對等測試:相同的輸入,相同的輸出。現在 Flash-attention 變成了可選功能,因此 pip install 'lerobot[groot]' 即可直接使用,您可以直接加載 NVIDIA 發佈的檢查點。
GR00T N1.7 在 LeRobot 中取代了 N1.5。如果您需要 N1.5,請固定版本為
lerobot==0.5.1。
MolmoAct2
來自 Allen Institute for AI 的視覺-語言-動作模型 MolmoAct2 現在已移植到 LeRobot,並涵蓋了完整的生命週期:微調(完整或 LoRA)、評估和實體機器人部署。內置校準修正的現成檢查點意味著您可以在 SO-100/101 上進行零樣本 (zero-shot) 運行:
lerobot-rollout \n --policy.path=lerobot/MolmoAct2-SO100_101-LeRobot \n --robot.type=so100_follower \n --robot.port=/dev/ttyACM0 \n --robot.cameras='{cam0: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}, cam1: {type: opencv, index_or_path: 2, width: 640, height: 480, fps: 30}}' \n --task="pick up the red cube" --duration=30
在 bf16 精度下,推理僅需約 12 GB,而 LoRA 微調可以在單個 24 GB GPU 上運行。請參閱 MolmoAct2 文檔。
EO-1
EO-1 是一個在交錯的視覺-文本-動作數據上進行預訓練的 VLA,現已加入 LeRobot:由論文作者之一貢獻,採用 Qwen2.5-VL-3B 作為骨幹並配備 flow-matching 動作頭。您可以使用標準的 lerobot-train 工作流並透過 --policy.type=eo1 來訓練它。詳情請參閱 文檔 和 論文。
Multitask DiT
Multitask Diffusion Transformer 策略將 TRI Large Behavior Models 的配方引入了 LeRobot:一個約 450M 參數的擴散 Transformer,以 CLIP 視覺和語言嵌入為條件,因此一個模型可以學習透過自然語言選擇的多個任務。它同時支持擴散 (diffusion) 和 flow-matching 目標,且規模小到足以讓您自行訓練。請參閱 文檔。
EVO1
VLA 不需要很大。EVO1 將其策略壓縮在 0.77B 參數中,採用 InternVL3-1B 骨幹並配備 flow-matching 動作頭,規模小到足以在普通的 GPU 上進行微調並實時運行。它開箱即用,支持兩階段微調和實時分塊 (Real-Time Chunking)。請參閱 EVO1 文檔 和 論文。
獎勵模型:了解您的機器人何時成功
LeRobot v0.6.0 提供了一個統一的獎勵模型 API,包含兩個新的預訓練模型,無需任務特定訓練即可從影片和語言中評分成功率與進度。
Robometer
Robometer 是一個預訓練的通用獎勵模型:將 lerobot/Robometer-4B 指向任何 LeRobot 數據集,它即可從原始影片加上語言指令中評估任務進度和成功率,無需任務特定訓練。它基於 Qwen3-VL-4B 並透過超過一百萬條機器人軌跡數據集的軌跡比較進行訓練 (RSS 2026 論文)。
TOPReward
TOPReward 實現了完全的零樣本 (zero-shot):完全不需要獎勵權重。它封裝了一個現成的 VLM (Qwen3-VL),並讀取在給定軌跡影片和任務指令下,Token "True" 的對數概率 (log-probability)。任何具備能力的 VLM 都能成為獎勵函數。
兩者都附帶標註腳本,可將每幀進度曲線寫入您的數據集,為獎勵感知行為複製 (RA-BC)、數據集質量檢查和進度疊加影片做好準備。請查看 Robometer 和 TOPReward 文檔。
數據集:更快的加載,更豐富的數據
數據集處理新增了自定義影片編碼、端到端深度、透過 VLM 進行的大規模語言標註,以及高達 2 倍的數據加載速度。
您的編碼器,您的規則
錄製不再受限於單一的硬編碼編碼器。新的 --dataset.rgb_encoder.* 選項開放了完整的編碼介面(編碼器、質量、像素格式、GOP、預設值),且 vcodec=auto 會在回退到預設的軟體 AV1 編碼器之前,先探測硬體編碼器(如 NVENC, VideoToolbox, VAAPI 和 QSV)。對於現有數據集,一個命令即可重新編碼所有內容:
lerobot-edit-dataset \n --repo_id ${HF_USER}/my_dataset \n --operation.type reencode_videos \n --operation.rgb_encoder.vcodec h264 \n --operation.rgb_encoder.crf 23
完整細節請參閱 影片編碼文檔。
深度支持,端到端
插入 Intel RealSense,設置 use_depth: true,LeRobot 即可端到端地記錄深度圖:以毫米為單位捕捉,與您的 RGB 相機一起壓縮為緊湊的 12-bit 深度影片流,並在訓練時解碼回物理單位。深度會在錄製期間和 lerobot-dataset-viz 中實時渲染,並適用於 SO-100/101, Koch, OpenArm, reBot, Unitree G1 等設備。
大規模語言標註
您的數據集不再是每個回合 (episode) 只有一個任務字串。LeRobot 數據集現在原生儲存豐富的語言標註(帶時間戳的子任務、計劃、記憶、修正、語音以及每個相機的 VQA 對),新的 lerobot-annotate CLI 會使用觀察您回合的 VLM 自動填充這些內容:
lerobot-annotate \n --repo_id=${HF_USER}/my_dataset \n --new_repo_id=${HF_USER}/my_dataset_annotated \n --vlm.model_id=Qwen/Qwen2.5-VL-7B-Instruct \n --push_to_hub=true
接著,一個 YAML 配方層會在採樣時將這些標註渲染成對話風格的訓練訊息:這正是明天長程 (long-horizon)、會說話的機器人策略將要訓練的數據。您可以使用 HF Jobs 來擴大規模,並閱讀 標註流水線文檔 以了解更多。
高達 2 倍的數據加載速度
在影片數據集上的訓練現在開箱即用即可提升約 2 倍:多相機幀並行解碼,dataloader workers 傳輸緊湊的 uint8 幀(進程間內存減少 4 倍),且持久化 workers 在不同 epoch 之間保持解碼器緩存。加載大型數據集的子集 (episodes=[...]) 從數分鐘縮短至毫秒級(在我們的基準測試中從 275 秒降至 0.06 秒)。採樣現在也是確定性且可恢復的,因此中斷的訓練可以從完全相同的樣本點重新開始。
基準測試:一個 CLI 評估所有模型
六個新的模擬基準測試加入了評估中心,全部可以透過單個 lerobot-eval 命令訪問。
- LIBERO-plus 在七個維度(從照明和相機視角到重寫的指令)上,使用 LIBERO 約 10,000 個擾動變體對 VLA 進行壓力測試。它會告訴您策略何時失效。
- RoboTwin 2.0 在 SAPIEN 上涵蓋了 50 個雙手操作任務,並帶有強大的領域隨機化 (domain randomization),且在 Hub 上提供 超過 10 萬條現成可訓練軌跡。
- RoboCasa365 在移動操作機在 2,500 個程序化生成的廚房中涵蓋了 365 個廚房任務,是我們產品線中最大的任務範圍。
- RoboCerebra 透過在語言落地中間指令下鏈接 3 到 6 個子目標的回合來評估長程行為,並附帶 6,660 個回合的數據集。
- RoboMME 是一場記憶力考試:您的策略能計算重複次數、追蹤隱藏物體並模仿演示的程序嗎?涵蓋 4 個記憶套件的 16 個任務。
- VLABench 測試操作中的知識與推理,從物理問題到端到端煮咖啡等複合任務。
lerobot-eval \n --policy.path=lerobot/smolvla_robotwin \n --env.type=robotwin \n --env.task=beat_block_hammer \n --eval.n_episodes=100 --eval.batch_size=1
模擬器後端需要特定的系統依賴項及其安裝步驟;每個文檔頁面都有確切的配方,如果您想跳過設置,每個基準測試都提供現成的 Docker 鏡像。
連同 LIBERO、Meta-World 和 NVIDIA IsaacLab-Arena,這使得一個屋簷下擁有了九個基準測試家族,新的 新增基準測試指南 記錄了如何接入您的基準測試。
訓練與推理
訓練與部署現在擁有專用的 rollout CLI,具備 DAgger 風格的數據收集、用於多 GPU 擴展的 FSDP 以及透過 HF Jobs 進行的雲端訓練。
lerobot-rollout:部署有了自己的 CLI
部署策略以前是在 lerobot-record 之上的黑客手段。新的 lerobot-rollout CLI 使部署成為獨立的工作流,具有可插拔的策略和推理後端(包括針對慢速兼容 VLA 的實時分塊功能)。base 策略僅運行策略。sentry 持續記錄,在運行時輪換回合並上傳到 Hub。highlight 保持一個環形緩衝區,並在您按下按鍵時儲存最後 N 秒,因此有趣的時刻永遠不會遺失。episodic 鏡像了經典的回合/重置記錄工作流。而 dagger 則將部署轉化為數據收集。
使用 DAgger 策略時,您可以觀察策略運行,在出錯的瞬間按下按鍵(或 USB 腳踏板),使用您的領導臂 (leader arm) 接管以記錄修正,然後交回控制權。在您接管之前,驅動的領導臂會移動到跟隨者 (follower) 的姿勢,因此交接過程不會有衝擊。每個修正幀都會標記一個 intervention 標籤,生成的數據集可直接用於下一次微調:
lerobot-rollout \n --strategy.type=dagger \n --policy.path=${HF_USER}/my_policy \n --robot.type=so100_follower \n --robot.port=/dev/ttyACM0 \n --teleop.type=so101_leader \n --teleop.port=/dev/ttyACM1 \n --dataset.repo_id=${HF_USER}/dagger_corrections \n --dataset.single_task="Grasp the block"
部署、收集修正、微調、重複:機器人學習飛輪現在只需一個 CLI 標誌。請閱讀 部署文檔。
FSDP:訓練比您的 GPU 還大的模型
機器人基礎模型正在超越單個 GPU。LeRobot 訓練現在透過 Accelerate 支持 FSDP (完全分片數據並行):參數、梯度和優化器狀態會分片到各個 GPU,且檢查點會重新匯集為一個普通的單文件 model.safetensors,可以像其他策略一樣加載。您甚至可以在不同數量的 GPU 上恢復 FSDP 運行。請參閱 多 GPU 訓練文檔。
使用 HF Jobs 進行雲端訓練
沒有 GPU?沒問題。只需添加一個標誌,相同的 lerobot-train 命令現在就可以在雲端運行:
lerobot-train \n --dataset.repo_id=${HF_USER}/so101_test \n --policy.type=act \n --policy.repo_id=${HF_USER}/my_policy \n --job.target=a10g-small
如果需要,LeRobot 會將您的本地數據集推送到私有 Hub 倉庫,提交任務,將日誌流式傳輸到您的終端,並在結束時將訓練好的策略推送到 Hub。您可以透過 --job.target 從 T4 選擇到 8× H200(計算費用按需計費)。查看文檔
代碼庫:更精簡、更整潔
現在安裝更輕量,依賴項受功能門控,可用性改進包括 Foxglove 串流、uv lock、Wayland 鍵盤支持和基於插件的組件。
pip install lerobot現在真正輕量化,基礎依賴項減少了約 40%。功能範圍的額外功能 ([training],[core_scripts],[evaluation],...) 涵蓋了其餘部分,且缺失依賴錯誤會確切告訴您需要添加哪個額外功能。如果您只使用 LeRobot 數據集,不再需要安裝與硬體相關的依賴項 ;)- 支援的 PyTorch 移至 2.7–2.11,Linux
uv安裝預設固定了 CUDA 12.8 wheels。--policy.dtype=bfloat16現在透過 Accelerate 驅動真正的混合精度訓練。 - 提交的
uv.lock是 CI、Docker 和開發的權威依賴規範,文檔包含每一步的uv安裝路徑,甚至可以透過單個標誌選擇您的 CUDA wheel。 --display_mode=foxglove將遠程操作、錄製和展開流式傳輸到 Foxglove,這是機器人界廣泛使用的視覺化工具。它適用於遠程設置,且lerobot-dataset-viz具備可捲動的數據集播放功能。- Pip 可安裝的
lerobot_env_*包現在會自動註冊其環境。插件系統涵蓋所有五種組件類型:機器人、相機、遠程操作器、策略和環境。 - 錄製期間的鍵盤控制現在可在 Wayland、透過 SSH、在無頭設備以及無需輔助功能權限的 macOS 上運行。
請查看 發佈說明 以獲取完整列表及重大變更的遷移指南。
社群與生態系統
新的工具如 LeLab 瀏覽器 UI、Isaac Teleop 整合、硬體指南和插件策略指南擴大了可訪問性。
- LeLab 將整個 LeRobot 工作流(校準、遠程操作、錄製、本地或在 HF Jobs 上訓練、部署)置於瀏覽器 UI 中,無需 CLI。它目前支持 SO-ARM101。去試試看!
- Isaac Teleop 讓您透過 NVIDIA 的 Isaac Teleop 棧 在 CloudXR/OpenXR 上使用 VR 控制器遠程操作 SO-101,這是與 NVIDIA 團隊合作的成果。請參閱 文檔。
- 新的 計算硬體指南 回答了每個新手都會問的兩個問題:我需要哪種 GPU,以及訓練需要多長時間?它提供了每個策略家族的測量 VRAM 範圍,以及從 RTX 4090 到 4× H100 的參考訓練時間。
- 重寫後的 新增策略指南 展示了如何發佈您自己的策略,無論是樹內 (in-tree) 還是作為無需 PR 的插件包。
最後的想法
除了標題功能外,v0.6.0 還包含了代碼庫中數百個錯誤修復、文檔改進和生活品質升級,從更聰明的預設值到更可靠的 CI。
我們要向社群中的每個人表示衷心的感謝。本次發佈包含了來自學術界、工業界和愛好者團隊的工作,他們選擇 LeRobot 作為其模型和基準測試的家園。每一個 PR 和錯誤報告都在推動開源機器人技術前進。
敬請期待更多內容 🤗 在這裡 開始使用吧! – LeRobot 團隊 ❤️