VeRL-Omni: 擴散和全模態模型的強化學習訓練框架
VeRL-Omni: 擴散和全模態模型的強化學習訓練框架
vLLM 已宣布 VeRL-Omni 的預發布版本,這是一個專為多模態生成模型設計的通用強化學習(RL)後訓練框架。基於 verl 和 vllm-omni 構建,VeRL-Omni 解決了非自回歸和全模態模型(如擴散變換器和統一理解與生成架構)的 RL 訓練所面臨的獨特挑戰。
多模態強化學習的技術挑戰
VeRL-Omni 旨在解決與多模態生成強化學習相關的三個主要技術障礙:
- **架構擴充:**該框架將 RL 能力擴充至擴散變換器骨幹(例如 Qwen-Image)、混合 AR-DiT 架構(例如 Qwen-Omni)以及統一模型(例如 BAGEL、HunyuanImage3.0)。
- **異質 Rollout 管線:**與基於文本的 RL 不同,多模態 Rollout 是連續潛在空間中的去噪軌跡。這些管線通常涉及多個組件,例如文本編碼器、擴散變換器 (DiT) 和變分自編碼器 (VAE)。
- **工作負載排程:**多模態 RL 需要協調複雜的工作流程,其中獎勵函數通常本身就是多模態模型(例如 VLM 評判或 OCR 評分器),且生成 Rollout 通常比文本生成展現出更高的記憶體峰值。
關鍵框架特性
VeRL-Omni 提供了一個模組化且高效的堆疊,用於多模態 RL 訓練:
- **高效多模態 Rollout:**透過整合 vLLM-Omni,該框架利用高吞吐異步服務進行多模態生成,採用逐步連續批次和嵌入快取來優化效率。
- **彈性獎勵引擎:**該系統同時支援基於規則和基於模型的獎勵(例如 VLM-as-judge)。vLLM 用於高效的獎勵模型推論,獎勵計算與 Rollout 和訓練過程重疊以降低延遲。
- **模組化訓練後端:**該框架包含多種訓練器——例如 DiffusersFSDP、Megatron 和 VeOmni——內建了針對擴散和全模態模型的優化,支援包括 FSDP、USP 和 TP 的平行策略。
- **硬體相容性:**VeRL-Omni 同時支援 NVIDIA GPU 和 Ascend NPU。
支援的模型與演算法
VeRL-Omni 支援多種架構和 RL 演算法,其中多種目前已發布或正在開發中:
| 模型 | 架構 | 模態 | 演算法 | 狀態 |
|---|---|---|---|---|
| Qwen-Image | DiT | 文字 → 圖像 | FlowGRPO, MixGRPO, GRPO-Guard | 已發布 |
| BAGEL | 統一理解 + 生成 | 文字 + 圖像 | FlowGRPO | PR 已就緒 |
| Qwen3-Omni-Thinker | AR | 文字 / 圖像 / 影片 / 音訊 | GSPO | PR 已就緒 |
| Wan2.2 | DiT | 文字 → 影片 | DanceGRPO | 開發中 |
| SD3.5 | DiT | 文字 → 圖像 | DPO | 開發中 |
| HunyuanImage-3.0 | 統一理解 + 生成 | 文字 + 圖像 | MixGRPO, SRPO | 規劃中 |
FlowGRPO 實作與效能
VeRL-Omni 實作了 FlowGRPO,這是一種用於流匹配模型的線上策略方法。訓練工作流程分為四個階段:Rollout 生成(收集軌跡和圖像)、獎勵模型評分、使用類似 CLIP 的損失進行策略優化,以及從訓練器到 Rollout 工作者的定期權重同步。
效能基準
在使用 NVIDIA H800 GPU 對 Qwen-Image 進行 LoRA 微調的 OCR 評分任務測試中,該框架展示了以下吞吐量:
- **共置訓練:**0.305 圖像/GPU/s,每步驟時間為 420 秒。
- **異步獎勵:**0.280 圖像/GPU/s,每步驟時間為 360 秒。將獎勵模型移至專用 GPU 可將每步驟的牆上時間減少約 14%。
在 4 顆 NVIDIA H200 GPU 上對 Qwen-Image 進行完整模型微調(非 CFG)時,該框架達成了 0.510 圖像/GPU/s,每步驟約為 250 秒。
未來路線圖
VeRL-Omni 目前處於預發布階段。未來開發路線圖包括:
- **擴充模型支援:**添加更多用於圖像、影片和音訊生成的開源擴散和全模態模型。
- **進階演算法:**整合新的 RL 演算法,例如 DiffusionNFT。
- **完全異步的 RL:**開發端到端的異步管線,涵蓋 actor、rollout 和 reward,以提升 GPU/NPU 利用率。
- **vLLM-Omni 共同優化:**透過先進的平行處理、量化和批次來進一步加速 rollout。
- **優化的訓練器:**釋放更多基於 Megatron-core 和 VeOmni 的訓練器引擎。
- **硬體擴充:**加強 Ascend NPU 路徑並添加更多硬體後端。