redai-infra/Relax
An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
해결하는 문제
Relax는 옴니모달 대규모 언어 모델(LLM)을 위해 설계된 고성능 강화 학습(RL) 포스트 트레이닝 프레임워크입니다. 텍스트, 시각 및 오디오와 같은 다양한 모달리티에 걸쳐 RL 훈련을 확장하는 문제를 해결하는 동시에, 롤아웃(추론) 및 훈련 단계의 순차적 특성으로 인해 일반적으로 발생하는 GPU 유휴 시간을 제거합니다.
작동 방식
Relax는 Ray Serve를 기반으로 구축된 서비스 지향 아키텍처를 사용하며, 서로 다른 역할(Actor, Rollout, Critic 등)이 독립적인 서비스로 배포됩니다. TransferQueue라고 불리는 시스템을 사용하여 훈련과 추론을 분리함으로써, 이를 별도의 GPU 클러스터에서 병렬로 실행할 수 있도록 합니다. 이러한 비동기 실행은 세 가지 모드를 통해 지원됩니다:
- Colocate (Sync): Actor와 Rollout이 GPU를 공유하고 리소스를 타임셰어링합니다.
- Fully Async: 각 역할이 독립된 클러스터에서 실행되며, 스트리밍 데이터 교환 및 Distributed Checkpoint Service (DCS)를 통한 비동기 가중치 동기화를 수행합니다.
- Hybrid: Actor와 Rollout은 별도의 배치 그룹을 사용하지만, 참조 모델과 같은 다른 구성 요소는 Actor의 GPU에서 인프로세스로 실행됩니다.
백엔드의 경우, 훈련을 위해 Megatron-LM(TP/PP/CP/EP 병렬성 지원)을, 고처리량 추론을 위해 SGLang을 통합합니다.
대상 사용자
포스트 트레이닝 멀티모달 모델을 연구하는 AI 연구자 및 엔지니어, 특히 Qwen3 시리즈 또는 GLM5와 같은 모델의 RL 훈련을 확장해야 하거나 복잡한 에이전트 RL 워크플로우를 구현하려는 분들을 대상으로 합니다.
주요 특징
- 옴니모달 지원: 텍스트, 시각 및 오디오 RL을 위한 통합 프레임워크로, Qwen3-Omni와 같은 모델의 엔드 투 엔드 훈련을 지원합니다.
- 에이전트 RL: 클로즈드 루프 훈련을 위한 멀티턴 상호작용, 손실 마스킹 및 멀티모달 컨텍스트 전달을 지원합니다.
- 탄력적 롤아웃 스케일링: 훈련 중에 HTTP REST API를 통해 추론 엔진을 동적으로 추가하거나 제거할 수 있습니다.
- 풍부한 알고리즘 제품군: GRPO, GSPO, SAPO, CISPO 및 On-Policy Distillation을 즉시 지원합니다。
- 프로덕션급 운영: 자동 복구를 위한 HealthManager와 WandB, TensorBoard, ClearML를 위한 중앙 집중식 Metrics Service를 포함합니다.