verl-project/verl-omni
Multimodal RL training framework for diffusion & omni models
解決的問題
VeRL-Omni 提供了一個穩定且高性能的強化學習(RL)後訓練框架,適用於多模態生成模型。它解決了多模態 RL 的特定挑戰——例如複雜的輸入/輸出模式、計算瓶頸,以及高效滾動生成的需求——這些問題與僅限文字的大型語言模型(LLM)訓練有顯著差異。
工作原理
此框架建立在 verl 之上,並整合了多項優化技術,以加速 RL 流程:
- 快速滾動: 使用
vLLM-Omni後端,透過滾動路由、批量處理和嵌入快取優化生成。 - 非同步獎勵服務: 支援多種獎勵模型(例如 HPSv3、GenRM-OCR),並採用非同步計算,使獎勵階段與滾動階段重疊執行。
- 模組化後端: 提供可選的訓練後端,如 VeOmni 和 FSDP2,支援可組合的平行處理(USP/TP/DP),適用於分散式訓練。
- 穩定機制: 實作滾動修正,跳過 logP 重新計算,確保更快速且更穩定的擴散 RL 流程。
適用對象
致力於擴散模型(影像、影片、音訊)與多模態模型後訓練對齊的研究人員與開發者,這些模型能同時處理文字、影像、音訊與影片。
主要特色
- 廣泛的模型支援: 兼容 Qwen-Image、SD3.5、Wan2.2、LTX2.3 和 Qwen3-Omni。
- 多樣的演算法支援: 實作多種 RL 演算法,包括 FlowGRPO、DiffusionNFT、Diffusion DPO 和 GSPO。
- 高吞吐量: 在參考設定下,端到端吞吐量比基於 diffusers 的實作高出約 25%。
- 硬體支援: 支援 NVIDIA GPU 與 Ascend NPU。
相關
- Dispatch
- Dispatch
- 專案
- 專案
- 專案