pollen-robotics/microduck_rl

RL training environments for Microduck (mjlab)

解决的问题

本项目为小型双足机器人 Microduck 提供强化学习(RL)训练环境,旨在解决“仿真到现实的差距”——即在仿真中学习的行为难以迁移到物理机器人上的难题。通过高保真度的执行器建模和领域随机化技术,实现复杂步态和技巧的仿真到现实的迁移。

工作原理

系统使用 MuJoCo Warp 和 PPO(近端策略优化)在 50 Hz 下训练策略。为确保这些策略能在真实机器人上运行,系统包含以下特性:

  • BAM 执行器物理模型:将 Dynamixel XL330 伺服电机建模至电压控制律,包含反电动势和摩擦。
  • 领域随机化:训练期间随机化电池电压、电压下降、命令延迟和摩擦。
  • 齿隙模拟:包含特定训练变体,模拟齿轮间隙(每关节 ±1°),提升机器人对机械缺陷的鲁棒性。
  • ONNX 导出:训练好的策略以 ONNX 格式导出,并内置观测值归一化器,可直接部署到机器人运行时。

适用人群

  • 从事双足行走机器人研究与开发的科研人员和开发者。
  • 希望为 Microduck 机器人训练自定义步态或技巧的用户。
  • 对小型机器人仿真到现实迁移技术感兴趣的工程师。

主要亮点

  • 多样化的任务库:包含平坦与崎岖地形上的行走、跌倒恢复、起身、坐下、踢球,甚至滑轮滑等环境。
  • 热插拔策略:所有策略共享 61 维观测契约,使机器人能无缝切换行走、恢复和执行技巧。
  • 简化部署publish 工具允许用户将策略上传至 Hugging Face Hub,通过 CLI 工具轻松安装到物理机器人上。
  • 硬件感知训练:精确建模执行器电压和负载相关摩擦,而非使用理想 PD 控制器。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目