LeRobot v0.6.0 發佈說明 / 新功能

LeRobot v0.6.0 專注於透過整合能夠想像未來狀態的策略、用於成功檢測的獎勵模型,以及能將失敗轉化為訓練數據的部署 CLI,來閉合機器人學習迴圈。此版本透過六個新的模擬基準測試、深度感測支援,以及透過 Hugging Face Jobs 提供的雲端訓練功能,擴展了生態系統。

世界模型與預測策略

LeRobot v0.6.0 引入了三種策略,旨在測試世界模型是否能透過在訓練期間學習想像未來狀態來提升機器人性能。

VLA-JEPA

基於 Qwen3-VL-2B 構建,VLA-JEPA 使用 JEPA 世界模型,根據模型的動作在潛在空間中預測未來幀。世界模型僅在訓練期間使用,並在推理時捨棄,因此不會產生額外的推理成本。預訓練的基礎檢查點(包括一個用於 DROID 的檢查點)已可在 Hugging Face Hub 上取得。

LingBot-VA

LingBot-VA 是一種自回歸影片-動作模型,可以分塊預測未來的影片和動作。它結合了真實觀察來落實其想像。使用者可以透過 --policy.save_predicted_video=true 旗標儲存機器人想像的 Rollouts,以便與實際結果進行比較。推理需要具有 24–32 GB VRAM 的 GPU。

FastWAM

FastWAM 在單一網路中結合了約 5B 的影片生成專家和一個精簡的動作專家。雖然它在訓練期間學習「夢想」Rollouts,但在推理時會跳過此過程,直接對動作塊進行去噪。它可以從 lerobot/fastwam_base 檢查點進行微調。

擴展的視覺-語言-動作 (VLA) 模型庫

此版本顯著擴大了支援的 VLA 庫:

  • GR00T N1.7: NVIDIA 跨具身基礎模型的升級版,取代了 N1.5。它利用具有 flow-matching 動作頭的 Cosmos-Reason2-2B(基於 Qwen3-VL)。其整合性已針對 NVIDIA 原生的 Isaac-GR00T 實作進行了對等測試。
  • MolmoAct2: 來自 Allen Institute for AI 的 VLA。LeRobot 現在支援其完整的生命週期,包括 LoRA 微調以及在 SO-100/101 機器人上的零樣本部署。在 bf16 格式下,推理僅需約 12 GB VRAM。
  • EO-1: 一種在交錯的視覺-文本-動作數據上預訓練的 VLA,具有 Qwen2.5-VL-3B 骨幹網路和 flow-matching 動作頭。
  • Multitask DiT: 一個約 450M 參數的擴散 Transformer,以 CLIP 視覺和語言嵌入為條件,允許單一模型透過自然語言學習多種任務。
  • EVO1: 一個精簡的 0.77B 參數模型,使用 InternVL3-1B 骨幹網路和 flow-matching 動作頭,專為在普通 GPU 上進行即時執行而設計。

獎勵模型與成功檢測

LeRobot v0.6.0 引入了統一的獎勵模型 API (lerobot.rewards),以提供成功檢測和進度估計。

Robometer

Robometer 是一個基於 Qwen3-VL-4B 構建的通用獎勵模型,在超過一百萬條機器人軌跡上進行訓練。它可以從原始影片和語言指令中對任務進度和成功率進行評分,而不需要針對特定任務進行訓練。

TOPReward

TOPReward 透過封裝現成的 VLM (Qwen3-VL) 並讀取給定軌跡和指令下 "True" token 的對數機率,提供零樣本獎勵估計。

數據集增強與數據加載

數據集流水線的改進專注於靈活性、豐富性和速度:

  • 自定義影片編碼--dataset.rgb_encoder.* 選項允許使用者指定編解碼器、品質和像素格式。vcodec=auto 設定會在回退到 AV1 之前自動探測硬體編碼器 (NVENC, VideoToolbox, VAAPI, QSV)。
  • 端到端深度支援:LeRobot 現在支援在各種機器人上記錄深度圖(以毫米為單位擷取,並壓縮為 12-bit 深度影片流),包括 SO-100/101、Koch 和 Unitree G1。
  • VLM 驅動的標註lerobot-annotate CLI 使用 VLM(例如 Qwen2.5-VL-7B-Instruct)為數據集自動生成帶有時間戳的子任務、計畫和 VQA 對。
  • 性能提升:由於並行多鏡頭幀解碼和使用精簡的 uint8 幀,數據加載速度提升了達 2 倍。加載特定的回合子集從 275 秒縮短至 0.06 秒。

統一評估基準測試

現在可以透過 lerobot-eval CLI 使用六個新的模擬基準測試,每個測試都提供一個 Docker 鏡像和一個 SmolVLA 基準線:

  • LIBERO-plus:透過 10,000 個 LIBERO 的擾動變體來測試 VLA 的魯棒性。
  • RoboTwin 2.0:在 SAPIEN 上具有 50 個雙手操作任務,並具有強大的領域隨機化。
  • RoboCasa365:涵蓋 2,500 個程序化生成的廚房中的 365 個廚房任務。
  • RoboCerebra:使用鏈式子目標來評估長程行為。
  • RoboMME:一個測試計數、物體追蹤和程序模仿的記憶考試。
  • VLABench:測試操作知識和推理。

訓練與部署工作流

lerobot-rollout 與 DAgger

部署現在是透過 lerobot-rollout CLI 進行的專用工作流。一個關鍵功能是 DAgger 策略,它允許人類操作員在策略失敗時進行干預,使用領導臂記錄修正,並將該幀標記為 intervention。這些數據隨後將用於後續的微調。

可擴展訓練

  • FSDP 支援:透過 Accelerate 使用 Fully Sharded Data Parallel (FSDP),可以訓練超過單一 GPU 記憶體的模型。參數、梯度和優化器狀態會在 GPU 之間進行分片。
  • HF Jobslerobot-train 命令現在可以使用 --job.target 旗標在雲端執行,支援從 T4 到 8x H200 GPU 的硬體。

代碼庫與生態系統

  • 更精簡的安裝:基礎依賴減少了 40%,並使用功能範圍的 extras(例如 [training], [evaluation])來最小化安裝佔用。
  • 視覺化:與 Foxglove 整合,允許透過 --display_mode=foxglove 進行遠端操作和 Rollouts 串流。
  • LeLab:一個基於瀏覽器的 GUI,無需使用 CLI 即可進行校準、記錄和訓練,目前支援 SO-ARM101。
  • Isaac Teleop:與 NVIDIA 的合作,允許透過 Isaac Teleop 堆疊使用 VR 控制器進行 SO-101 遠端操作。

Sources