amazon-far/fpo-control

Flow Policy Gradients for Robot Control

이건 무엇인가요?

FPO++ Code ReleaseFlow Policy Gradients for Robot Control 논문과 함께 제공되는 공식 코드입니다. Flow Policy Optimization (FPO++) 알고리즘을 위한 재현 가능한 실험을 제공하며, 로봇 제어 정책을 학습하는 강화학습 방법입니다.


주요 구성 요소

구성 요소 목적 주요 종속성
isaaclab_experiments/ 6개 이상의 로봇 플랫폼에서의 속도 조건부 보행 실험. 훈련 스크립트, 예상 학습 곡선, 작업을 실행하기 위한 모든 환경 설정 포함. Isaac Lab (시뮬레이션 프레임워크), rsl_rl (액터-크리틱 및 온폴리시 실행자)
manipulation_experiments/ 다섯 가지 고도의 조작 작업에 대한 사전 훈련 및 미세 조정. FPO++, 일반 FPO, DPPO 베이스라인용 스크립트 제공. LeRobot (정책 아키텍처), robosuite (조작 시뮬레이터), DPPO (비전 트랜스포머 인코더), DexMimicGen (데이터 생성)

시작하기

  1. 리포지토리 클론 (하위 모듈 포함):
    git clone --recursive https://github.com/amazon-far/fpo-control.git
    cd fpo-control
    
  2. 실험 세트 선택 후 세팅 스크립트 실행:
    # 보행 (Isaac Lab)
    cd isaaclab_experiments
    bash setup_env.sh   # conda 환경 생성 및 종속성 설치
    source source_env.sh
    
    # 조작
    cd ../manipulation_experiments
    bash setup_env.sh
    source source_env.sh
    
  3. 선택한 디렉터리 내 README에 따라 정확한 훈련 명령어 실행 (예: python train.py --config ...). README에는 예상되는 학습 곡선도 기재되어 있어, 실행 결과가 논문과 일치하는지 확인할 수 있습니다.

라이선스 및 제3자 코드

이 리포지토리는 여러 외부 프로젝트를 포함하며, 각각 원래 라이선스 하에 유지됩니다:

  • Isaac Lab (BSD-3) – 시뮬레이션 코어 및 로봇 자산.
  • rsl_rl (BSD-3) – FPO용으로 적응된 RL 유틸리티.
  • LeRobot (Apache-2.0) – 정책 네트워크 정의.
  • robosuite (MIT) – 조작 환경.
  • DPPO (MIT) – 비전 트랜스포머 인코더.
  • DexMimicGen (NVIDIA Source Code License, 비영리) – 고도의 손용 데이터 생성. 모든 저작권 표시는 수정된 파일에 유지됩니다.

개발자는 누구인가요?

이 작업은 Amazon FAR, UC Berkeley, Stanford, HKU, CMU 간의 협업입니다. 주저자는 Brent Yi와 Hongsuk Choi (동등 기여), 상급 지도는 Pieter Abbeel, Guanya Shi, Karen Liu, Angjoo Kanazawa가 담당합니다.


언제 사용할까요?

  • 연구: FPO++ 알고리즘을 새로운 로봇 작업에 재현하거나 확장.
  • 벤치마킹: FPO++를 일반 FPO 또는 DPPO와 비교하여 보행 또는 조작 벤치마크에서 평가.
  • 교육: 현실적인 로봇 시뮬레이터에서 환경, 정책, 훈련 루프를 포함한 완전한 RL 파이프라인을 학습.

요약

FPO++ Code Release는 유명한 시뮬레이션 및 RL 라이브러리를 기반으로 한, 로봇 보행 및 고도의 조작을 위한 최신 강화학습 실험을 실행할 수 있는 진정한 연구 수준의 소프트웨어 패키지입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트