redai-infra/Relax

An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

解决的问题

Relax 是一个专为全模态大语言模型(LLM)设计的高性能强化学习(RL)后训练框架。它解决了跨不同模态(文本、视觉和音频)扩展 RL 训练的挑战,同时消除了通常由 Rollout(推理)和训练阶段的顺序特性导致的 GPU 空闲时间。

工作原理

Relax 使用基于 Ray Serve 构建的服务化架构,其中不同的角色(Actor、Rollout、Critic 等)作为独立服务进行部署。它采用名为 TransferQueue 的系统来解耦训练和推理,允许它们在独立的 GPU 集群上并行运行。这种异步执行通过三种模式提供支持:

  • Colocate (Sync): Actor 和 Rollout 共享 GPU 并进行资源分时复用。
  • Fully Async: 各个角色在独立的集群上运行,通过流式数据交换和通过 Distributed Checkpoint Service (DCS) 进行异步权重同步。
  • Hybrid: Actor 和 Rollout 使用不同的放置组,但其他组件(如参考模型)在 Actor 的 GPU 上进行进程内运行。

在后端方面,它集成了用于训练的 Megatron-LM(支持 TP/PP/CP/EP 并行)和用于高吞吐量推理的 SGLang。

适用对象

面向从事多模态模型后训练工作的 AI 研究人员和工程师,特别是那些需要为 Qwen3 系列或 GLM5 等模型扩展 RL 训练,以及实现复杂智能体 RL 工作流的人员。

亮点

  • 全模态支持:统一的文本、视觉和音频 RL 框架,支持 Qwen3-Omni 等模型的端到端训练。
  • 智能体 RL:支持闭环训练的多轮交互、损失掩码(loss masking)和多模态上下文传递。
  • 弹性 Rollout 扩展:可以在训练过程中通过 HTTP REST API 动态添加或移除推理引擎。
  • 丰富的算法套件:开箱即用支持 GRPO、GSPO、SAPO、CISPO 和 On-Policy Distillation。
  • 生产级运维:包含用于自动恢复的 HealthManager 以及用于 WandB、TensorBoard 和 ClearML 的集中式 Metrics Service。