LeRobot v0.5.0 版本說明 / 新功能概覽

LeRobot v0.5.0 是 Hugging Face 機器人函式庫的重大擴充,加入了對人形硬體的支援、更廣泛的視覺‑語言‑動作 (VLA) 策略,以及在資料錄製與訓練上的顯著效能提升。本次發佈著重於在硬體、模型與資料管線上擴展生態系統。

硬體擴充與人形支援

LeRobot v0.5.0 引入了對 Unitree G1 人形機器人 的完整支援,標誌著該函式庫首次整合人形機器人。此支援包括全身控制 (WBC) 以同時協調行走與操作,並提供專用的遠端操作與導航介面。

其他硬體新增包括:

  • OpenArm & OpenArm Mini:支援 OpenArm 機械手臂及其伴隨的遠端操作器,包含雙手配置。
  • Earth Rover:首次將行動機器人整合於戶外導航。
  • OMX Robot:新型機械手臂,具校準支援與可設定的抓手參數。
  • CAN Bus Motor Support:整合 RobStride 與 Damiao 基於 CAN 的馬達控制器,讓使用專業級高扭力致動器成為可能。
  • SO-100/SO-101:將實作合併至單一程式碼庫,以便更輕鬆維護雙手設定。

新策略與模型倉庫

此版本新增了六項策略與技術,以提升機器人學習與推論的回應速度。

視覺‑語言‑動作 (VLA) 模型

  • Pi0-FAST:使用頻域動作序列標記化 (FAST) 的自回歸 VLA。它利用基於 Gemma 300M 的動作專家產生離散化的動作標記。
  • Wall‑X:基於 Qwen2.5‑VL 的 VLA 策略,採用流匹配頭部實現跨形態機器人控制。
  • X‑VLA:基於 Florence2 的 VLA,提供機器人學習的替代骨幹。

推論與訓練增強

  • Real‑Time Chunking (RTC):推論時的技術,將新預測與進行中的動作混合。此方式降低延遲,讓流匹配策略(如 Pi0 系列、SmolVLA 與 Diffusion)更具回應性。
  • SARM (Stage‑Aware Reward Modeling):針對長時程任務的方法,預測任務階段與該階段內的進度,而非僅依賴單一全域線性進度訊號。
  • PEFT Support:大型 VLA 現可透過政策層級設定,使用 LoRA 及其他參數效率微調方法進行微調。

資料集效能與工具

LeRobot v0.5.0 優化了資料管線,以消除錄製與訓練的瓶頸。

錄製與編碼

  • Streaming Video Encoding:影格現在於捕獲時即時編碼,消除錄製回合之間的等待時間。此功能包含自動偵測硬體編碼器以加速 GPU。
  • Encoding Speed:平行編碼已成為預設,使整體編碼速度提升 3 倍。

訓練與管理

  • Training Speed:影像訓練因消除資料存取瓶頸與改進影像轉換支援,速度提升 10 倍。
  • Dataset Tools:新功能包括用於階層學習的子任務標註、為提升儲存效率的影像轉影片轉換,以及用於資料集檢查的 info 操作。

EnvHub 與模擬整合

EnvHub 允許使用者透過 HubEnvConfig 從 Hugging Face Hub 直接載入模擬環境。此方式透過下載與執行遠端的 make_env 函式,免除本機套件安裝的需求。

此外,此版本整合了 NVIDIA IsaacLab‑Arena,提供基於 NVIDIA Isaac Sim 的 GPU 加速、大規模平行環境實例,以供強化學習使用。

程式碼基礎現代化

  • Core Requirements:最低需求升級至 Python 3.12+,並遷移至 Transformers v5。
  • Extensibility:支援第三方政策外掛,使用者可透過 pip 註冊自訂政策為可安裝套件,無需修改核心函式庫。
  • Hardware Support:PyTorch 版本範圍已更新,以支援 NVIDIA Blackwell GPU。
  • Telemetry:遠端 Rerun 可視化現在支援壓縮影像,以提升頻寬使用效率。

Sources