redai-studio/Relax

An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax – 异步多模态强化学习引擎

是什么 – Relax(Reinforcement Engine Leveraging Agentic X‑modality)是一个用于大型多模态语言模型后训练强化学习的开源框架。它支持 PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 等全套在线策略算法,同时在单一管道中处理文本、图像、视频和音频。

为何重要 – LLM 的强化学习通常受限于推理(rollout)阶段。Relax 通过自定义的 TransferQueue 将 rollout 与训练步骤解耦,并将每个组件作为独立的 Ray Serve 服务运行。这使得系统具备以下特性:

  • 完全异步 – rollout、actor、reference、优势计算和奖励模型可部署在不同的 GPU 集群上,确保每块 GPU 始终处于工作状态。
  • 弹性扩展 – 可通过 REST API 实时增减推理引擎,适用于云突发或联邦集群场景。
  • 多模态统一 – 同一代码路径支持纯文本、视觉语言和音视频任务,实现 Qwen‑3‑Omni 等模型的端到端强化学习。
  • 生产就绪 – 内置健康检查、自动恢复、集中式指标(WandB / TensorBoard / ClearML)和实时通知功能。

核心组件

层级 角色
入口点 train.py – CLI、Ray 集群连接、控制器启动
编排 ControllerServiceRegistry – 调度循环、管理放置组
组件 Ray Serve 部署:ActorRolloutCriticActorFwdAdvantagesGenRM
引擎 基于 SGLang 的 rollout 引擎,奖励路由,数据过滤
后端 Megatron‑LM(TP/PP/CP/EP)用于训练,SGLang 用于高吞吐推理
分布式 Ray actor 组 + 分布式检查点服务(DCS)实现 NCCL/GLOO 权重同步

提供三种执行模式:

  • 共置(同步) – actor 与 rollout 共享 GPU(内存高效,严格在线策略)。
  • 完全异步 – 每个角色运行在独立 GPU 集群上,通过 TransferQueue 通信。
  • 混合模式 – rollout 与 actor 分离,但 reference/advantage 步骤保留在进程内,降低开销的同时仍支持数据流式传输。

算法与奖励

Relax 配备了丰富的算法套件(PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 变体、GSPO、SAPO、CISPO、在线策略蒸馏)和即插即用的奖励中心(数学验证、GPQA、F1、IFBench、多模态 Open‑R1,以及内置的 LLM 作为裁判的 GenRM)。添加新奖励只需将 Python 文件放入 relax/engine/rewards/ 即可。


快速上手(Docker 优先)

# 拉取官方镜像(包含 CUDA、PyTorch、Megatron‑LM、SGLang、Ray)
docker pull ghcr.io/redai-studio/relaxrl:latest

# 启动容器并挂载工作区
docker run -it --gpus all --ipc=host --network=host \
  -v /path/to/workspace:/root ghcr.io/redai-studio/relaxrl:latest bash

# 容器内操作
git clone https://github.com/redai-studio/Relax.git /root/Relax
cd /root/Relax && pip install -e .

快速启动脚本(一行命令)

  1. 纯文本数学 RL – 使用 dapo-math-17k 数据集在 Qwen‑3‑4B 上运行 8 GPU 的 PPO。
  2. 视觉语言 – 使用 multimodal-open-r1-8k-verified 数据集在 Qwen‑3‑VL‑4B 上运行 8 GPU 的 GRPO。
  3. 多模态(图像 + 音频) – 使用 AVQA-R1-6K 数据集在 Qwen‑3‑Omni‑30B‑A3B 上运行 16 GPU(2 节点)的 GRPO。

每个脚本自动处理数据集下载(通过 hf download)、模型获取,并以适当参数启动 train.py。日志显示 rollout 进度和训练步骤;检查点以 Megatron DCP 格式保存,可使用提供的转换脚本转为 HuggingFace 权重。


何时使用 Relax

  • 多模态 RL 研究 – 需要单一代码库同时训练文本、图像、视频和音频。
  • 大规模模型强化学习扩展 – 异步架构可让数十块 GPU 持续运行,即使跨多个集群。
  • 生产级微调 – 内置健康监控、指标聚合和告警机制,提升长时间任务的可靠性。
  • 新策略实验 – 模块化算法注册表支持直接插入自定义损失,无需修改核心引擎。

更多学习资源


总结 – Relax 是一个面向生产、高度可配置的 RL 平台,弥合了大型多模态 LLM 与强化学习微调之间的鸿沟,提供异步执行、弹性扩展以及开箱即用的广泛算法支持。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目