verl-project/verl-omni

Multimodal RL training framework for diffusion & omni models

解決的問題

VeRL-Omni 解決了多模態生成模型在強化學習 (RL) 後訓練階段面臨的特定挑戰。與僅限文本的 LLM 不同,這些模型具有不同的 I/O 模式、計算特性與執行時瓶頸,需要專門的訓練框架來確保穩定性與高吞吐量。

工作原理

基於 verl 框架構建,VeRL-Omni 為擴散模型、統一理解/生成模型以及全模態 (omni-modality) 模型的 RL 訓練提供專用環境。它透過以下核心機制優化訓練流水線:

  • 高吞吐量 Rollouts:使用 vLLM-Omni 作為 rollout 後端,加速多模態生成。
  • 非同步獎勵服務 (Async Reward Serving):實現非同步獎勵計算與 HTTP 打分器,使獎勵階段與 rollout 階段重疊,減少閒置時間。
  • 模組化後端:支援可選的訓練後端,如 VeOmni 與 FSDP2,並具有可組合的並行性 (USP/TP/DP) 以實現分散式擴展。
  • 穩定性工具:包括 rollout 修正與確定性執行,以穩定擴散 RL 訓練。

適用對象

專為從事圖像、影片、音訊或其組合(全模態)生成模型 RL 後訓練的研究人員與工程師設計,例如使用 Qwen-Image、SD3.5 或 Wan2.2 的模型。

亮點

  • 廣泛的模型支援:相容擴散生成器(圖像/影片/音訊)、統一多模態模型與全模態模型。
  • 演算法整合:支援廣泛的 RL 演算法,包括 FlowGRPO、Flow-DPPO、MixGRPO、DiffusionNFT 與 DPO。
  • 效能提升:在特定設置下,端到端吞吐量比基於 diffusers 的實作高出約 25%。
  • 硬體靈活性:同時支援標準 GPU 與 Ascend NPU。