MINT-SJTU/Evo-RL
We release Evo-RL, the opensource real-world offline RL on So-101 and AgileX PiPER for easier reproduction.
Evo‑RL – 실세계 강화학습 툴킷
소개 – Evo‑RL은 실세계 로봇 플랫폼에서 오프라인 및 온라인 강화학습을 수행하기 위한 오픈소스 프레임워크입니다. LeRobot 라이브러리(로봇 데이터 수집 및 정책 학습을 위한 Hugging Face 프로젝트)를 기반으로 하며, 다음과 같은 전체 파이프라인을 추가합니다.
- 하드웨어 통합 – Seeed Studio SO‑101 암 및 AgileX PiPER / PiPER‑X 로봇을 지원하며, 시리얼, CAN‑bus, 카메라 배선에 대한 상세 지침을 제공합니다.
- 데이터 수집 – 사람이 로봇을 원격 조작하면서 다중 모달 관측 데이터(RGB, RealSense 깊이, 관절 상태)를 Hugging Face 데이터셋에 자동으로 기록할 수 있는 명령줄 도구 (
lerobot‑human‑inloop‑record)를 제공합니다. - 가치 함수 학습 및 추론 – 수집된 데이터셋에서 return‑to‑go 추정기(기본값 pistar06)를 학습하고, 가치, 어드밴티지, 이진 "우수 궤적" 태그를 기록합니다.
- 정책 학습 – 표준
lerobot‑train스크립트를 사용하여 어드밴티지 조건부 태그를 작업 설명의 일부로 사용하는 언어 조건부 정책을 학습합니다. - 폐루프 배포 – 학습된 정책을 루프 내 인간(human‑in‑the‑loop) 환경에 배포하여 다음 라운드의 데이터를 수집함으로써 반복적인 개선을 가능하게 합니다.
이 저장소에는 스크립트, 구성 템플릿, Docker가 필요 없는 conda 설치 방식, 그리고 Hugging Face의 공개 RW‑RL dataset이 포함되어 있습니다.
퀵스타트 요약
# 클론 및 환경 설정
git clone https://github.com/MINT-SJTU/Evo-RL.git && cd Evo-RL
conda create -y -n evo-rl python=3.10
conda activate evo-rl
pip install -e . # 패키지 및 CLI 진입점 설치
이후 다음을 수행할 수 있습니다:
lerobot-teleoperate로 하드웨어 검증 (단일 암 또는 양팔 설정에 대한 정확한 명령 문자열은 README 참조).lerobot-human-inloop-record로 데이터셋 기록.lerobot-value-train으로 가치 모델 학습.lerobot-value-infer로 가치 태그 추론.lerobot-train으로 정책 학습.- 동일한
lerobot-human-inloop-record명령에--policy.path=<checkpoint>를 추가하여 폐루프 배포 실행.
README의 주요 기능
| 영역 | 저장소 제공 기능 |
|---|---|
| 하드웨어 지원 | SO‑101 (시리얼) 및 AgileX PiPER/PiPER‑X (USB‑CAN) 로봇에 대한 상세 구성(안정적인 장치 경로 권장 사항 및 캘리브레이션 파일 레이아웃 포함). |
| 데이터셋 처리 | Hugging Face로의 원클릭 푸시 (--dataset.push_to_hub=true), 자동 데이터셋 보고서 (lerobot-dataset-report), 공개 RW‑RL 데이터셋. |
| 가치 함수 | bfloat16을 지원하는 학습 스크립트 (lerobot-value-train), accelerate를 통한 다중 GPU 실행, 사용자 정의 가치 모델을 위한 플러그인 아키텍처. |
| 어드밴티지 조건부 정책 (ACP) | 가치 추론 후 3개의 새로운 열 (value_<TAG>, advantage_<TAG>, acp_indicator_<TAG>)이 데이터셋에 추가됩니다. 정책 학습 스크립트는 이진 지표를 텍스트 태그로 읽어들이며 드롭아웃 제어가 가능합니다. |
| 엔드투엔드 파이프라인 | README는 설치부터 다음 데이터 수집 라운드까지의 7단계를 안내하여 사용자가 전체 연구 루프를 재현할 수 있도록 합니다. |
| 커뮤니티 및 재현성 | 프로젝트 웹사이트, 위챗 그룹, 곧 발표될 논문 링크, Apache‑2.0 라이선스 제공; 모든 코드, 모델, 데이터셋은 공개적으로 재사용 가능합니다. |
대상 사용자
- 로봇 공학 연구자: 저비용 매니퓰레이터에서 실세계 강화학습을 수행하기 위한 준비된 스택이 필요한 분.
- ML 엔지니어: 로봇 데이터로 어드밴티지 조건부 학습을 실험하고자 하는 분.
- 교육자: 원격 조작 데이터 수집부터 실제 하드웨어 정책 배포까지의 실습 과정을 원하는 분.
언급된 제한 사항
- 논문과 사전 학습된 모델은 "곧 출시 예정"이므로 현재 저장소는 주로 파이프라인 코드와 RW‑RL 데이터셋을 제공합니다.
- 하드웨어별 단계(예: 캘리브레이션, CAN‑bus 시리얼 ID)는 지원되는 로봇에 대한 접근이 필요하며, 저장소는 시뮬레이션 대체 기능을 제공하지 않습니다.
인용 및 라이선스
- 라이선스: Apache‑2.0 (
LICENSE배지 참조). - 인용: 논문은 향후 발표 예정; 현재는 저장소 URL을 인용하십시오.
위의 모든 정보는 저장소의 README에서 직접 가져온 것이며, 외부적인 가정은 추가되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트