redai-studio/Relax
An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
Relax – 异步多模态强化学习引擎
是什么 – Relax(Reinforcement Engine Leveraging Agentic X‑modality)是一个用于大型多模态语言模型后训练强化学习的开源框架。它支持 PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 等全套在线策略算法,同时在单一管道中处理文本、图像、视频和音频。
为何重要 – LLM 的强化学习通常受限于推理(rollout)阶段。Relax 通过自定义的 TransferQueue 将 rollout 与训练步骤解耦,并将每个组件作为独立的 Ray Serve 服务运行。这使得系统具备以下特性:
- 完全异步 – rollout、actor、reference、优势计算和奖励模型可部署在不同的 GPU 集群上,确保每块 GPU 始终处于工作状态。
- 弹性扩展 – 可通过 REST API 实时增减推理引擎,适用于云突发或联邦集群场景。
- 多模态统一 – 同一代码路径支持纯文本、视觉语言和音视频任务,实现 Qwen‑3‑Omni 等模型的端到端强化学习。
- 生产就绪 – 内置健康检查、自动恢复、集中式指标(WandB / TensorBoard / ClearML)和实时通知功能。
核心组件
| 层级 | 角色 |
|---|---|
| 入口点 | train.py – CLI、Ray 集群连接、控制器启动 |
| 编排 | Controller、Service、Registry – 调度循环、管理放置组 |
| 组件 | Ray Serve 部署:Actor、Rollout、Critic、ActorFwd、Advantages、GenRM |
| 引擎 | 基于 SGLang 的 rollout 引擎,奖励路由,数据过滤 |
| 后端 | Megatron‑LM(TP/PP/CP/EP)用于训练,SGLang 用于高吞吐推理 |
| 分布式 | Ray actor 组 + 分布式检查点服务(DCS)实现 NCCL/GLOO 权重同步 |
提供三种执行模式:
- 共置(同步) – actor 与 rollout 共享 GPU(内存高效,严格在线策略)。
- 完全异步 – 每个角色运行在独立 GPU 集群上,通过 TransferQueue 通信。
- 混合模式 – rollout 与 actor 分离,但 reference/advantage 步骤保留在进程内,降低开销的同时仍支持数据流式传输。
算法与奖励
Relax 配备了丰富的算法套件(PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 变体、GSPO、SAPO、CISPO、在线策略蒸馏)和即插即用的奖励中心(数学验证、GPQA、F1、IFBench、多模态 Open‑R1,以及内置的 LLM 作为裁判的 GenRM)。添加新奖励只需将 Python 文件放入 relax/engine/rewards/ 即可。
快速上手(Docker 优先)
# 拉取官方镜像(包含 CUDA、PyTorch、Megatron‑LM、SGLang、Ray)
docker pull ghcr.io/redai-studio/relaxrl:latest
# 启动容器并挂载工作区
docker run -it --gpus all --ipc=host --network=host \
-v /path/to/workspace:/root ghcr.io/redai-studio/relaxrl:latest bash
# 容器内操作
git clone https://github.com/redai-studio/Relax.git /root/Relax
cd /root/Relax && pip install -e .
快速启动脚本(一行命令)
- 纯文本数学 RL – 使用
dapo-math-17k数据集在 Qwen‑3‑4B 上运行 8 GPU 的 PPO。 - 视觉语言 – 使用
multimodal-open-r1-8k-verified数据集在 Qwen‑3‑VL‑4B 上运行 8 GPU 的 GRPO。 - 多模态(图像 + 音频) – 使用
AVQA-R1-6K数据集在 Qwen‑3‑Omni‑30B‑A3B 上运行 16 GPU(2 节点)的 GRPO。
每个脚本自动处理数据集下载(通过 hf download)、模型获取,并以适当参数启动 train.py。日志显示 rollout 进度和训练步骤;检查点以 Megatron DCP 格式保存,可使用提供的转换脚本转为 HuggingFace 权重。
何时使用 Relax
- 多模态 RL 研究 – 需要单一代码库同时训练文本、图像、视频和音频。
- 大规模模型强化学习扩展 – 异步架构可让数十块 GPU 持续运行,即使跨多个集群。
- 生产级微调 – 内置健康监控、指标聚合和告警机制,提升长时间任务的可靠性。
- 新策略实验 – 模块化算法注册表支持直接插入自定义损失,无需修改核心引擎。
更多学习资源
- 文档网站 – https://redai-studio.github.io/Relax(双语,涵盖架构、异步训练、混合模式、弹性 rollout 扩展等完整指南)
- 论文 – arXiv:2604.11554(提供研究背景与性能数据)
- GitHub 讨论 – README 标签中链接了 WeChat 二维码、Docker 镜像和社区问答。
总结 – Relax 是一个面向生产、高度可配置的 RL 平台,弥合了大型多模态 LLM 与强化学习微调之间的鸿沟,提供异步执行、弹性扩展以及开箱即用的广泛算法支持。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目