redai-infra/Relax
An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
解決的問題
Relax 是一個專為全模態大語言模型(LLM)設計的高性能強化學習(RL)後訓練框架。它解決了跨不同模態(文本、視覺和音訊)擴展 RL 訓練的挑戰,同時消除了通常由 Rollout(推理)與訓練階段的順序特性導致的 GPU 空閒時間。
工作原理
Relax 使用基於 Ray Serve 構建的服務化架構,其中不同的角色(Actor、Rollout、Critic 等)作為獨立服務進行部署。它採用名為 TransferQueue 的系統來解耦訓練與推理,允許它們在獨立的 GPU 集群上並行運行。這種非同步執行透過三種模式提供支持:
- Colocate (Sync): Actor 與 Rollout 共享 GPU 並進行資源分時復用。
- Fully Async: 各個角色在獨立的集群上運行,透過串流數據交換與透過 Distributed Checkpoint Service (DCS) 進行非同步權重同步。
- Hybrid: Actor 與 Rollout 使用不同的配置組,但其他組件(如參考模型)在 Actor 的 GPU 上進行進程內運行。
在後端方面,它集成了用於訓練的 Megatron-LM(支援 TP/PP/CP/EP 並行)和用於高吞吐量推理的 SGLang。
適用對象
面向從事多模態模型後訓練工作的 AI 研究人員與工程師,特別是那些需要為 Qwen3 系列或 GLM5 等模型擴展 RL 訓練,以及實現複雜智能體 RL 工作流的人員。
亮點
- 全模態支持:統一的文本、視覺與音訊 RL 框架,支援 Qwen3-Omni 等模型的端到端訓練。
- 智能體 RL:支援閉環訓練的多輪互動、損失遮罩(loss masking)與多模態上下文傳遞。
- 彈性 Rollout 擴展:可以在訓練過程中透過 HTTP REST API 動態新增或移除推理引擎。
- 豐富的演算法套件:開箱即用支援 GRPO、GSPO、SAPO、CISPO 與 On-Policy Distillation。
- 生產級維運:包含用於自動復原的 HealthManager 以及用於 WandB、TensorBoard 與 ClearML 的集中式 Metrics Service。