Lei-Kun/RL-100

[Science Robotics 2026] Official Implementation of the paper RL-100

해결하는 문제

RL-100은 로봇 조작 정책을 향상시키기 위한 통합 프레임워크를 제공합니다. 초기의 모방 학습(행동 클로닝)과 고성능이며 신뢰할 수 있는 실제 환경 배포 사이의 격차를 메우기 위해, 강화학습(RL)을 활용한 후처리 정책을 반복 가능한 파이프라인으로 제공합니다.

작동 방식

시스템은 정적 데이터에서 능동적 상호작용으로 이어지는 다단계 파이프라인을 구현합니다:

  1. 행동 클로닝: 인간의 시연 데이터로부터 정책을 초기화합니다.
  2. 오프라인 RL: 기록된 트래잭터리를 사용하여 정책-그래디언트 업데이트로 정책을 개선합니다.
  3. 온라인 RL: 실제 세계 또는 시뮬레이션 상호작용을 통해 정책을 추가로 미세 조정합니다.
  4. 원스텝 증류: 다단계 확산 또는 흐름 정책을 효율적인 원스텝 정책(예: Diffusion-to-CM)으로 변환하여 빠른 실제 로봇 추론을 가능하게 합니다.
  5. 데이터 플라이휠: 오프라인으로 학습된 정책을 배포하여 새로운 로봇 롤아웃을 수집하고, 이를 다시 학습 데이터셋에 통합하여 다음 라운드의 오프라인 RL을 더욱 향상시키는 반복 루프입니다.

대상 사용자

시각 운동 정책 개발에 종사하는 로봇 연구자 및 엔지니어를 위한 것으로, 원격 조작 데이터에서 견고하고 배포 가능한 로봇 제어로 전환할 수 있는 표준화된 방법이 필요한 분들에게 적합합니다.

주요 특징

  • 유연한 정책 백본: 확산 및 흐름 정책 모두를 지원합니다.
  • 다중 모달 관측: 3D 포인트 클라우드와 2D RGB 이미지 모두 호환됩니다.
  • 다양한 제어: 액션 청크와 고주파 단일 액션 제어 모두 지원합니다.
  • 통합된 데이터 도구: 원격 조작 데이터 수집 및 반복적인 Zarr 데이터셋 관리 유틸리티를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트