redai-infra/Relax
An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
解决的问题
Relax 是一个专为全模态大语言模型(LLM)设计的高性能强化学习(RL)后训练框架。它解决了跨不同模态(文本、视觉和音频)扩展 RL 训练的挑战,同时消除了通常由 Rollout(推理)和训练阶段的顺序特性导致的 GPU 空闲时间。
工作原理
Relax 使用基于 Ray Serve 构建的服务化架构,其中不同的角色(Actor、Rollout、Critic 等)作为独立服务进行部署。它采用名为 TransferQueue 的系统来解耦训练和推理,允许它们在独立的 GPU 集群上并行运行。这种异步执行通过三种模式提供支持:
- Colocate (Sync): Actor 和 Rollout 共享 GPU 并进行资源分时复用。
- Fully Async: 各个角色在独立的集群上运行,通过流式数据交换和通过 Distributed Checkpoint Service (DCS) 进行异步权重同步。
- Hybrid: Actor 和 Rollout 使用不同的放置组,但其他组件(如参考模型)在 Actor 的 GPU 上进行进程内运行。
在后端方面,它集成了用于训练的 Megatron-LM(支持 TP/PP/CP/EP 并行)和用于高吞吐量推理的 SGLang。
适用对象
面向从事多模态模型后训练工作的 AI 研究人员和工程师,特别是那些需要为 Qwen3 系列或 GLM5 等模型扩展 RL 训练,以及实现复杂智能体 RL 工作流的人员。
亮点
- 全模态支持:统一的文本、视觉和音频 RL 框架,支持 Qwen3-Omni 等模型的端到端训练。
- 智能体 RL:支持闭环训练的多轮交互、损失掩码(loss masking)和多模态上下文传递。
- 弹性 Rollout 扩展:可以在训练过程中通过 HTTP REST API 动态添加或移除推理引擎。
- 丰富的算法套件:开箱即用支持 GRPO、GSPO、SAPO、CISPO 和 On-Policy Distillation。
- 生产级运维:包含用于自动恢复的 HealthManager 以及用于 WandB、TensorBoard 和 ClearML 的集中式 Metrics Service。