pollen-robotics/microduck_rl
RL training environments for Microduck (mjlab)
解決的問題
本專案為小型雙足機器人 Microduck 提供強化學習(RL)訓練環境,專注於解決「模擬到現實的差距」——即在模擬中學習的行為難以遷移到實體機器人上的挑戰。透過高保真度的執行器建模與領域隨機化技術,實現複雜步態與技巧的模擬到現實遷移。
工作原理
系統使用 MuJoCo Warp 與 PPO(近端策略優化)在 50 Hz 下訓練策略。為確保這些策略能在真實機器人上運作,系統包含以下特性:
- BAM 執行器物理模型:將 Dynamixel XL330 伺服馬達建模至電壓控制法則,包含反電動勢與摩擦。
- 領域隨機化:訓練期間隨機化電池電壓、電壓下降、指令延遲與摩擦。
- 齒隙模擬:包含特定訓練變體,模擬齒輪間隙(每關節 ±1°),提升機器人對機械缺陷的韌性。
- ONNX 導出:訓練完成的策略以 ONNX 格式導出,並內建觀測值歸一化器,可直接部署至機器人執行時環境。
適用對象
- 致力於雙足行走機器人研究與開發的科研人員與開發者。
- 希望為 Microduck 機器人訓練自訂步態或技巧的使用者。
- 對小型機器人模擬到現實遷移技術感興趣的工程師。
主要亮點
- 多樣化的任務圖書館:包含平坦與崎嶇地形上的行走、跌倒復原、起身、坐下、踢球,甚至滑輪滑等環境。
- 熱插拔策略:所有策略共享 61 維觀測契約,使機器人能無縫切換行走、復原與執行技巧。
- 簡化部署:
publish工具允許使用者將策略上傳至 Hugging Face Hub,透過 CLI 工具輕鬆安裝至實體機器人。 - 硬體感知訓練:精確建模執行器電壓與負載相關摩擦,而非使用理想 PD 控制器。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案