LeRobot v0.4.0 發行說明 / 新功能

LeRobot v0.4.0 是對開源機器人庫的重大更新,旨在提升機器人學習的可擴展性、彈性與可及性。此版本引入了全新資料集基礎設施、具高容量的視覺-語言-動作 (VLA) 模型,以及用於硬體整合的模組化插件系統。

可擴展的資料基礎設施與 Datasets v3.0

LeRobot v0.4.0 引入 LeRobotDataset v3.0,徹底改造資料集基礎設施以支援大規模的機器人學習。此版本專為處理超過 400GB 的資料集而設計,例如 Open X Embodiment (OXE) 與 Droid。

v3.0 的主要增強功能

  • Chunked Episode Format:支援在 OXE 級別處理大規模資料集。
  • Streaming Capabilities:提供更快的載入時間與無縫的影片資料串流。
  • Unified Parquet Metadata:以結構化的 Parquet 檔案取代分散的 JSON 檔案,以簡化中繼資料管理。
  • Performance Gains:縮短資料集初始化時間並提升記憶體效能。

資料集編輯工具

全新的 lerobot-edit-dataset CLI 允許使用者透過以下操作來策劃與最佳化資料集:

  • 刪除特定的 episodes。
  • 依比例或 episode 索引分割資料集。
  • 新增或移除特徵。
  • 將多個資料集合併為單一統一的集合。

擴充的模擬環境

LeRobot 現在提供更廣泛的模擬基準支援,以促進機器人策略的訓練與評估。

  • LIBERO Support:整合 LIBERO,這是一個開放的 VLA 策略基準,包含超過 130 個任務,建立統一的 VLA 評估環境。
  • Meta-World Integration:整合 Meta-World,這是一個包含超過 50 個任務的多任務操作基準。此支援透過標準化使用 gymnasium ≥ 1.0.0mujoco ≥ 3.0.0 以確保確定性的隨機種子。

程式碼基礎與訓練最佳化

模組化資料處理管線

為了彌合原始感測器資料與模型需求之間的差距,LeRobot v0.4.0 引入 Processors。此模組化管線系統使用 ProcessorStep 元件來處理正規化、斷詞化與裝置搬移等任務。

提供兩種專門的管線類型:

  • PolicyProcessorPipeline:針對高效能訓練與推論中使用的批次張量進行最佳化。
  • RobotProcessorPipeline:設計用於使用單一資料點的即時機器人控制。

多 GPU 訓練

訓練現在整合了 Hugging Face Accelerate,允許使用者透過單一指令在多個 GPU 上擴展實驗。這會使訓練時間與使用的 GPU 數量成比例縮減(例如使用 2 顆 GPU 時可將時間減半)。

開放世界概括策略

LeRobot v0.4.0 整合了多個最先進的基礎模型,以提升機器人在多樣環境中的推理與概括能力。

PI0 與 PI0.5

由 Physical Intelligence 開發,這些 VLA 模型旨在開放世界概括。PI0.5 特別以其透過共同訓練多樣的多模態網路資料、語音指令與多環境機器人資料,來適應新環境的能力而聞名。

GR00T N1.5

透過與 NVIDIA 的合作整合,GR00T N1.5 是一個跨形態的基礎模型。它利用多模態輸入(語言與影像)執行複雜的操作任務,訓練資料結合了真實人形資料、來自 NVIDIA Isaac GR00T Blueprint 的合成資料,以及網際網路規模的影片資料。

硬體整合與插件系統

LeRobot 引入插件系統,允許第三方硬體透過 pip install 整合,而無需修改核心函式庫。此系統提升了可擴充性,並防止核心函式庫膨脹。

新硬體整合

  • Reachy 2:支援來自 Pollen Robotics 的 Reachy 2,適用於實體控制與模擬。
  • Mobile Teleoperation:使用全新的管線系統,使用者現在可透過 iOS 或 Android 裝置遠端操作從屬機械臂,RobotProcessor 會處理必要的動作空間轉換。

教育資源

Hugging Face 推出了開源的 Robot Learning CourseModern Robot Learning Tutorial。課程涵蓋經典機器人學、用於模仿學習的生成模型(VAE、擴散模型)以及強化學習。教程提供實作導向、從原理出發的現代技術,並附有可直接使用的程式碼範例。

Sources