VeRL-Omni v0.2.0 發佈說明 / 更新內容
VeRL-Omni v0.2.0 為全模態強化學習 (RL) 建立了生產級的基礎,重點在於提高擴散 (diffusion) RL 的吞吐量並穩定全模態模型的訓練堆疊。本次發佈的核心在於兩項主要進展:實現了擴散 RL 的請求級批處理 (request-level batching),以及引入了可重複使用的全模態訓練架構。
透過請求級批處理實現更快的擴散 RL
VeRL-Omni v0.2.0 透過捨棄序列執行,顯著降低了擴散 RL 的 rollout 延遲。在之前的版本中,擴散 rollout 經常受到序列 DiT 前向傳播的瓶頸限制,導致 GPU 利用率不佳。
技術改進
- 請求級批處理 (Request-Level Batching): vLLM-Omni 現在將相容的請求打包成更大的 transformer 前向傳播,而不是透過序列迴圈進行處理。這已成為支援的擴散適配器 (diffusion adapters) 的預設 rollout 路徑,允許透過調度參數進行明確的並行控制。
- V1 Trainer 整合: 擴散 RL 現在使用 V1 trainer 路徑,使其與 VeRL-Omni 中使用的現代 trainer 架構保持一致,並能實現未來 rollout 與訓練執行的解耦。
- 正確性修復: 此更新解決了關鍵領域以確保策略一致性,包括請求批處理後的擴散 log-probs、非同步 rollout 語義、rank-local LoRA 權重更新路徑,以及 rollout-correction hooks。
性能基準測試
使用 Qwen-Image LoRA OCR 配方,轉向請求級打包 (request-level packing) 將 GPU 利用率從約 80% 提高到 100%。這使得單獨生成時間減少了 52%,從 226 秒降至 108 秒。
對於在 512 px 下使用 True-CFG 的 Qwen-Image LoRA,建議的 max_num_seqs 調優範圍是 8 到 32。SD3.5 由於記憶體佔用較輕,支援更高的並行度,其 max_num_seqs 最高可達 256。
穩定的全模態訓練架構
VeRL-Omni v0.2.0 從特定模型的整合轉向為可重複使用的全模態訓練堆疊。這使得多模態自回歸訓練可以更自然地整合到現有的 trainer、adapter 與 rollout 結構中。
全模態訓練堆疊
- V1 Trainer 架構: 全模態配方現在受益於更清晰的 worker 編排與標準配置覆寫,提升了與 vLLM-Omni rollouts 的一致性。
- 可重複使用的全模態模型適配器 (Omni Model Adapter): 一個共享介面 (
OmniModelBase) 處理模型設定、處理器配置、可訓練階段選擇、FSDP 準備以及 rollout 一致性。這消除了為每個新架構進行一次性佈線的需要。 - 模組化調用流程:
main_omni.py入口點將線上全模態任務導向至 verl PPO V1 路徑。PPO trainer 管理 RL 迴圈 (rollout 調度、優勢計算與策略更新),而特定的OmniModelBase適配器 (例如Qwen3OmniThinkerAdapter) 處理模型特定的邏輯,例如剝離非活動模組並將前向傳播重定向至目標組件。
MMK12 基準測試結果
新路徑的穩定性透過 MMK12 錨點配方得到證實,該配方在 4 x H800 80GB GPU 上使用 GSPO 與 LoRA (rank 32) 在 K12 視覺數學推理 (image-to-text) 上訓練 Qwen3-Omni。該設定達成了:
- 驗證獎勵 (Validation Reward): 0.833
- Actor-Rollout Pearson 相關係數: 0.998
- GPU 記憶體使用量: 約 59 GB
擴展的模型與演算法支援
VeRL-Omni v0.2.0 擴展了對各種擴散與全模態模型的支援矩陣:
| Model / Family | Modality | Algorithm / Recipe | Key Update |
|---|---|---|---|
| LTX2.3 | Text $\to$ Video + Audio | FlowGRPO | 新增了使用 CLAP 與 ImageBind 獎勵的 text-to-video+audio 訓練。 |
| Qwen-Image-Edit | Text + Image $\to$ Image | FlowGRPO | 新增了圖像編輯數據準備與訓練介面。 |
| BAGEL | FlowGRPO | Text + Image | FlowGRPO |
| SD3.5 + DiNa-LRM | Text $\to$ Image | FlowGRPO | 實施了潛在獎勵模型 (latent reward model) 來評分擴散潛在空間 (diffusion latents) 的乾淨程度,從而繞過 VAE decode。 |
| Flow-DPPO | Text/Image $ o$ Image | Flow-DPPO | 針對 Qwen-Image 風格的擴散 RL,新增了新的策略優化配方。 |
| Wan2.2 | Text $\to$ Video | DanceGRPO | 新增了影片生成 RL 配方覆蓋範圍。 |
此外,本次發佈還包含了 Ascend NPU Dockerfiles 與安裝指南。
未來發展藍圖
VeRL-Omni 的後續開發包括:
- 實施完全非同步訓練以優化全模態模型。
- 擴展支援至 MiniMax-H3 與 MiniCPM-o 等模型,以及 OPD/M-OPD 等 trainer。
- 透過批處理、TQ 與 V1 trainer 整合,提高影片擴散訓練效率。
- 強化 rollout 程式碼以支援擴散與全模態情境下的非同步訓練。
- 開發支援涉及多輪對話與多階段生成的代理型 (agentic) RL。
Sources
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- Dispatch