VLARLKit/VLARLKit
Elegant VLA-RL library
해결하는 문제
VLARLKit은 강화 학습(RL)을 사용하여 Vision-Language-Action (VLA) 모델을 훈련하기 위한 연구자 친화적인 프레임워크를 제공합니다. 베이스 모델, RL 훈련 스택 및 로봇 시뮬레이션 환경 간의 일반적인 의존성 충돌 문제를 각 프로젝트와 프로세스를 분리함으로써 해결합니다.
작동 방식
이 라이브러리는 policy, rollout, runner 및 model 레이어를 분리하는 모듈형 아키텍처를 사용합니다. 소프트웨어 충돌을 방지하기 위해 모델 백엔드는 별도의 프로젝트로 관리되고 벤치마크 환경은 독립적인 ZMQ 프로세스로 실행되는 의존성 분리 설계를 채택했습니다. on-policy 및 off-policy 훈련을 모두 지원하며, 데이터 수집과 모델 업데이트가 동시에 이루어질 수 있도록 비동기 off-policy 훈련도 지원합니다.
대상 사용자
구현된 지능(embodied intelligence) 및 VLA 모델을 연구하며, RL 실험을 위해 유연하고 확장이 용이한 PyTorch 라이브러리가 필요한 AI 연구자를 위해 설계되었습니다.
주요 특징
- 디커플링된 아키텍처: 베이스 모델과 시뮬레이터 의존성을 분리하여 설치 충돌을 방지합니다.
- 폭넓은 알고리즘 지원: on-policy (PPO, GRPO), off-policy (DSRL, RLT) 및 모델 기반 RL (VLA-MBPO)을 포함합니다.
- VLA 모델 통합: π†.₅와 같은 flow-based 모델 및 OpenVLA-OFT와 같은 autoregressive 모델을 지원합니다。
- 시뮬레이션 벤치마크: LIBERO, ManiSkill 및 RoboTwin에 대한 통합 지원을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트