RLinf/RLinf
RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI
해결하는 문제
RLinf는 강화학습(Reinforcement Learning, RL) 모델 훈련을 위한 확장성 있고 유연한 인프라를 제공하며, 특히 에임보디드 AI(로보틱스)와 에이전트 AI를 대상으로 합니다. 분산 프로그래밍의 복잡성을 제거하여 코드를 변경하지 않고도 수많은 GPU 노드에 훈련을 확장할 수 있으며, 고성능 RL 훈련을 위한 처리량을 최적화합니다.
작동 방식
RLinf는 RL 훈련을 위한 견고한 핵심 인프라로, PPO, GRPO, SAC 등 다양한 알고리즘을 지원하고 FSDP, HuggingFace, SGLang, vLLM 등의 다양한 백엔드와 통합됩니다. 에임보디드 RL의 경우 하이브리드 실행 모드를 사용하여 처리량을 증가시키며, NVIDIA GPU, Moore Threads(MUSA), Huawei Ascend(CANN), AMD(ROCm) 등 다양한 가속기들을 지원합니다.
대상 사용자
비전-언어-액션(VLA) 모델, 로봇 정책 학습, 에이전트 AI에 종사하는 연구자 및 개발자들을 위한 시스템으로, 대규모 분산 훈련과 실제 로봇 배포를 처리할 수 있는 능력을 필요로 하는 분들에게 적합합니다.
주요 특징
- 광범위한 하드웨어 지원: NVIDIA, AMD, Huawei Ascend, Moore Threads 가속기와 호환됩니다.
- 다양한 시뮬레이터 통합: Isaac Lab, LIBERO, RoboCasa, Metaworld 등과 호환됩니다.
- 실제 환경 적용 가능성: Franka 및 XSquare Turtle2와 같은 실제 로봇에서 온라인 정책 학습이 가능한 RLinf-USER 포함.
- 시스템 최적화: 동적 컴퓨팅 리소스 재할당을 위한 DynaRL과 MoE 통신을 가속화하는 FUSCO를 제공합니다.
- 다양한 RL 지원: 오프라인 IQL 및 SFT부터 온라인 RL, 대규모 모델용 GRPO 파인튜닝까지 모든 작업을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트