pollen-robotics/microduck_rl
RL training environments for Microduck (mjlab)
해결하는 문제
이 프로젝트는 소형 이족 보행 로봇인 마이크로덕(Microduck)을 위한 강화학습(RL) 학습 환경을 제공합니다. 특히 시뮬레이션에서 학습한 동작을 실제 로봇으로 전이하는 데 어려움을 겪는 '시뮬레이션에서 실제 환경으로의 격차(sim2real gap)' 문제를 해결하기 위해 고정밀 액추에이터 모델과 도메인 랜덤화를 사용합니다.
작동 방식
시스템은 MuJoCo Warp와 PPO(근접 정책 최적화)를 사용하여 50Hz로 정책을 학습합니다. 실제 로봇에서 정책이 작동하도록 하기 위해 다음 요소들을 포함합니다:
- BAM 액추에이터 물리 모델: Dynamixel XL330 서보를 전압 제어 법칙까지 고정밀로 모델링하며, 역기전력과 마찰을 포함합니다.
- 도메인 랜덤화: 학습 중 배터리 전압, 전압 강하, 명령 지연, 마찰을 무작위로 설정합니다.
- 백래시 시뮬레이션: 각 관절당 ±1°의 기어 간극을 모델링한 특수 학습 변형을 포함하여 기계적 불완전성에 대한 강건성을 높입니다.
- ONNX 내보내기: 학습된 정책은 관측값 정규화기를 내장한 ONNX 형식으로 내보내져, 로봇의 런타임에 직접 배포 가능합니다.
대상 사용자
- 이족 보행 로봇 기술 개발에 종사하는 로봇 연구자 및 개발자.
- 마이크로덕 로봇 사용자 중 커스텀 보행 패턴이나 기술을 학습하고자 하는 사용자.
- 소규모 로봇 기술에서 시뮬레이션에서 실제 환경으로의 전이 기법에 관심 있는 엔지니어.
주요 특징
- 다양한 작업 라이브러리: 평탄한 지형과 불규칙한 지형에서의 걷기, 넘어진 후 회복, 일어나기, 앉기, 공 차기, 심지어 롤러스케이팅까지 포함된 환경.
- 핫스왑 가능한 정책: 모든 정책이 61차원 관측 계약을 공유하여, 걷기, 회복, 기술 수행 간을 원활하게 전환 가능.
- 간편한 배포:
publish도구를 통해 정책을 Hugging Face Hub에 업로드하여 CLI 도구로 물리적 로봇에 쉽게 설치 가능. - 하드웨어 인식 학습: 이상적인 PD 컨트롤러가 아닌, 액추에이터 전압과 하중에 따른 마찰을 정확히 모델링.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트