redai-studio/Relax

An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax – 異步多模態強化學習引擎

是什麼 – Relax(Reinforcement Engine Leveraging Agentic X‑modality)是針對大型多模態語言模型進行後訓練強化學習的開源框架。它支援 PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 等完整的一次策略演算法,同時在單一流程中處理文字、影像、影片與音訊。

為何重要 – LLM 的強化學習通常受限於推論(rollout)階段。Relax 透過自訂的 TransferQueue 將 rollout 與訓練步驟解耦,並以獨立的 Ray Serve 服務運行各個元件。這使得系統具備以下特性:

  • 完全異步 – rollout、actor、reference、優勢計算與獎勵模型可部署於不同 GPU 集群,確保每塊 GPU 始終處於工作狀態。
  • 彈性擴展 – 可透過 REST API 即時增減推論引擎,適用於雲端突發或聯邦式集群。
  • 多模態統一 – 同一程式路徑支援純文字、視覺語言與音訊視覺任務,實現 Qwen‑3‑Omni 等模型的端對端強化學習。
  • 生產就緒 – 內建健康檢查、自動恢復、集中式指標(WandB / TensorBoard / ClearML)與即時通知功能。

核心元件

層級 角色
入口點 train.py – CLI、Ray 集群連接、控制器啟動
編排 ControllerServiceRegistry – 調度循環、管理放置群組
元件 Ray Serve 部署:ActorRolloutCriticActorFwdAdvantagesGenRM
引擎 基於 SGLang 的 rollout 引擎,獎勵路由,資料過濾
後端 Megatron‑LM(TP/PP/CP/EP)用於訓練,SGLang 用於高吞吐推論
分散式 Ray actor 群組 + 分散式檢查點服務(DCS)實現 NCCL/GLOO 權重同步

提供三種執行模式:

  • 共置(同步) – actor 與 rollout 共享 GPU(記憶體高效,嚴格在線策略)。
  • 完全異步 – 每個角色運行於獨立 GPU 集群上,透過 TransferQueue 通訊。
  • 混合模式 – rollout 與 actor 分離,但 reference/advantage 步驟保留在程序內,降低開銷同時仍支援資料串流。

算法與獎勵

Relax 提供豐富的演算法套件(PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 變體、GSPO、SAPO、CISPO、在線策略蒸餾)與即插即用的獎勵中心(數學驗證、GPQA、F1、IFBench、多模態 Open‑R1,以及內建的 LLM 作為裁判的 GenRM)。新增獎勵只需將 Python 檔案放入 relax/engine/rewards/ 即可。


快速上手(Docker 優先)

# 拉取官方鏡像(包含 CUDA、PyTorch、Megatron‑LM、SGLang、Ray)
docker pull ghcr.io/redai-studio/relaxrl:latest

# 啟動容器並掛載工作區
docker run -it --gpus all --ipc=host --network=host \
  -v /path/to/workspace:/root ghcr.io/redai-studio/relaxrl:latest bash

# 容器內操作
git clone https://github.com/redai-studio/Relax.git /root/Relax
cd /root/Relax && pip install -e .

快速啟動腳本(一行命令)

  1. 純文字數學 RL – 使用 dapo-math-17k 資料集在 Qwen‑3‑4B 上執行 8 GPU 的 PPO。
  2. 視覺語言 – 使用 multimodal-open-r1-8k-verified 資料集在 Qwen‑3‑VL‑4B 上執行 8 GPU 的 GRPO。
  3. 多模態(影像 + 音訊) – 使用 AVQA-R1-6K 資料集在 Qwen‑3‑Omni‑30B‑A3B 上執行 16 GPU(2 節點)的 GRPO。

每個腳本自動處理資料集下載(透過 hf download)、模型取得,並以適當參數啟動 train.py。日誌顯示 rollout 進度與訓練步驟;檢查點以 Megatron DCP 格式儲存,可使用提供的轉換腳本轉為 HuggingFace 權重。


何時使用 Relax

  • 多模態 RL 研究 – 需要單一程式碼庫同時訓練文字、影像、影片與音訊。
  • 大規模模型強化學習擴展 – 異步架構可讓數十塊 GPU 持續運作,即使跨多個集群。
  • 生產級微調 – 內建健康監控、指標聚合與告警機制,提升長時間任務的可靠性。
  • 新策略實驗 – 模組化演算法註冊表支援直接插入自訂損失,無需修改核心引擎。

更多學習資源


總結 – Relax 是一個面向生產、高度可配置的 RL 平台,彌合了大型多模態 LLM 與強化學習微調之間的鴻溝,提供異步執行、彈性擴展以及開箱即用的廣泛演算法支援。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案