LeRobot v0.5.0 版本說明 / 新功能概覽
LeRobot v0.5.0 是 Hugging Face 機器人函式庫的重大擴充,加入了對人形硬體的支援、更廣泛的視覺‑語言‑動作 (VLA) 策略,以及在資料錄製與訓練上的顯著效能提升。本次發佈著重於在硬體、模型與資料管線上擴展生態系統。
硬體擴充與人形支援
LeRobot v0.5.0 引入了對 Unitree G1 人形機器人 的完整支援,標誌著該函式庫首次整合人形機器人。此支援包括全身控制 (WBC) 以同時協調行走與操作,並提供專用的遠端操作與導航介面。
其他硬體新增包括:
- OpenArm & OpenArm Mini:支援 OpenArm 機械手臂及其伴隨的遠端操作器,包含雙手配置。
- Earth Rover:首次將行動機器人整合於戶外導航。
- OMX Robot:新型機械手臂,具校準支援與可設定的抓手參數。
- CAN Bus Motor Support:整合 RobStride 與 Damiao 基於 CAN 的馬達控制器,讓使用專業級高扭力致動器成為可能。
- SO-100/SO-101:將實作合併至單一程式碼庫,以便更輕鬆維護雙手設定。
新策略與模型倉庫
此版本新增了六項策略與技術,以提升機器人學習與推論的回應速度。
視覺‑語言‑動作 (VLA) 模型
- Pi0-FAST:使用頻域動作序列標記化 (FAST) 的自回歸 VLA。它利用基於 Gemma 300M 的動作專家產生離散化的動作標記。
- Wall‑X:基於 Qwen2.5‑VL 的 VLA 策略,採用流匹配頭部實現跨形態機器人控制。
- X‑VLA:基於 Florence2 的 VLA,提供機器人學習的替代骨幹。
推論與訓練增強
- Real‑Time Chunking (RTC):推論時的技術,將新預測與進行中的動作混合。此方式降低延遲,讓流匹配策略(如 Pi0 系列、SmolVLA 與 Diffusion)更具回應性。
- SARM (Stage‑Aware Reward Modeling):針對長時程任務的方法,預測任務階段與該階段內的進度,而非僅依賴單一全域線性進度訊號。
- PEFT Support:大型 VLA 現可透過政策層級設定,使用 LoRA 及其他參數效率微調方法進行微調。
資料集效能與工具
LeRobot v0.5.0 優化了資料管線,以消除錄製與訓練的瓶頸。
錄製與編碼
- Streaming Video Encoding:影格現在於捕獲時即時編碼,消除錄製回合之間的等待時間。此功能包含自動偵測硬體編碼器以加速 GPU。
- Encoding Speed:平行編碼已成為預設,使整體編碼速度提升 3 倍。
訓練與管理
- Training Speed:影像訓練因消除資料存取瓶頸與改進影像轉換支援,速度提升 10 倍。
- Dataset Tools:新功能包括用於階層學習的子任務標註、為提升儲存效率的影像轉影片轉換,以及用於資料集檢查的
info操作。
EnvHub 與模擬整合
EnvHub 允許使用者透過 HubEnvConfig 從 Hugging Face Hub 直接載入模擬環境。此方式透過下載與執行遠端的 make_env 函式,免除本機套件安裝的需求。
此外,此版本整合了 NVIDIA IsaacLab‑Arena,提供基於 NVIDIA Isaac Sim 的 GPU 加速、大規模平行環境實例,以供強化學習使用。
程式碼基礎現代化
- Core Requirements:最低需求升級至 Python 3.12+,並遷移至 Transformers v5。
- Extensibility:支援第三方政策外掛,使用者可透過
pip註冊自訂政策為可安裝套件,無需修改核心函式庫。 - Hardware Support:PyTorch 版本範圍已更新,以支援 NVIDIA Blackwell GPU。
- Telemetry:遠端 Rerun 可視化現在支援壓縮影像,以提升頻寬使用效率。