pollen-robotics/microduck_rl

RL training environments for Microduck (mjlab)

解決的問題

本專案為小型雙足機器人 Microduck 提供強化學習(RL)訓練環境,專注於解決「模擬到現實的差距」——即在模擬中學習的行為難以遷移到實體機器人上的挑戰。透過高保真度的執行器建模與領域隨機化技術,實現複雜步態與技巧的模擬到現實遷移。

工作原理

系統使用 MuJoCo Warp 與 PPO(近端策略優化)在 50 Hz 下訓練策略。為確保這些策略能在真實機器人上運作,系統包含以下特性:

  • BAM 執行器物理模型:將 Dynamixel XL330 伺服馬達建模至電壓控制法則,包含反電動勢與摩擦。
  • 領域隨機化:訓練期間隨機化電池電壓、電壓下降、指令延遲與摩擦。
  • 齒隙模擬:包含特定訓練變體,模擬齒輪間隙(每關節 ±1°),提升機器人對機械缺陷的韌性。
  • ONNX 導出:訓練完成的策略以 ONNX 格式導出,並內建觀測值歸一化器,可直接部署至機器人執行時環境。

適用對象

  • 致力於雙足行走機器人研究與開發的科研人員與開發者。
  • 希望為 Microduck 機器人訓練自訂步態或技巧的使用者。
  • 對小型機器人模擬到現實遷移技術感興趣的工程師。

主要亮點

  • 多樣化的任務圖書館:包含平坦與崎嶇地形上的行走、跌倒復原、起身、坐下、踢球,甚至滑輪滑等環境。
  • 熱插拔策略:所有策略共享 61 維觀測契約,使機器人能無縫切換行走、復原與執行技巧。
  • 簡化部署publish 工具允許使用者將策略上傳至 Hugging Face Hub,透過 CLI 工具輕鬆安裝至實體機器人。
  • 硬體感知訓練:精確建模執行器電壓與負載相關摩擦,而非使用理想 PD 控制器。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案