VLARLKit/VLARLKit

Elegant VLA-RL library

해결하는 문제

VLARLKit은 강화 학습(RL)을 사용하여 Vision-Language-Action (VLA) 모델을 훈련하기 위한 연구자 친화적인 프레임워크를 제공합니다. 베이스 모델, RL 훈련 스택 및 로봇 시뮬레이션 환경 간의 일반적인 의존성 충돌 문제를 각 프로젝트와 프로세스를 분리함으로써 해결합니다.

작동 방식

이 라이브러리는 policy, rollout, runner 및 model 레이어를 분리하는 모듈형 아키텍처를 사용합니다. 소프트웨어 충돌을 방지하기 위해 모델 백엔드는 별도의 프로젝트로 관리되고 벤치마크 환경은 독립적인 ZMQ 프로세스로 실행되는 의존성 분리 설계를 채택했습니다. on-policy 및 off-policy 훈련을 모두 지원하며, 데이터 수집과 모델 업데이트가 동시에 이루어질 수 있도록 비동기 off-policy 훈련도 지원합니다.

대상 사용자

구현된 지능(embodied intelligence) 및 VLA 모델을 연구하며, RL 실험을 위해 유연하고 확장이 용이한 PyTorch 라이브러리가 필요한 AI 연구자를 위해 설계되었습니다.

주요 특징

  • 디커플링된 아키텍처: 베이스 모델과 시뮬레이터 의존성을 분리하여 설치 충돌을 방지합니다.
  • 폭넓은 알고리즘 지원: on-policy (PPO, GRPO), off-policy (DSRL, RLT) 및 모델 기반 RL (VLA-MBPO)을 포함합니다.
  • VLA 모델 통합: π†.₅와 같은 flow-based 모델 및 OpenVLA-OFT와 같은 autoregressive 모델을 지원합니다。
  • 시뮬레이션 벤치마크: LIBERO, ManiSkill 및 RoboTwin에 대한 통합 지원을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트