verl-project/verl-omni

Multimodal RL training framework for diffusion & omni models

它解决了什么问题

VeRL-Omni 为多模态生成模型的强化学习(RL)后训练提供了一个稳定且高性能的框架。它解决了多模态强化学习特有的挑战——例如复杂的输入/输出模式、计算瓶颈以及高效采样生成的需求——这些挑战与仅文本的大型语言模型(LLM)训练有显著不同。

它如何工作

该框架基于 verl 构建,并集成了多种优化以加速强化学习流程:

  • 快速采样: 使用 vLLM-Omni 后端,通过采样路由、批处理和嵌入缓存优化生成过程。
  • 异步奖励服务: 支持多种奖励模型(例如 HPSv3、GenRM-OCR),并通过异步计算将奖励计算阶段与采样阶段重叠。
  • 模块化后端: 提供可选的训练后端,如 VeOmni 和 FSDP2,支持组合并行(USP/TP/DP)以实现分布式训练。
  • 稳定性机制: 实现采样修正,跳过 logP 重新计算,确保扩散强化学习流程更快且更稳定。

适用人群

致力于扩散模型(图像、视频、音频)和多模态模型后训练对齐的研究人员和开发者,这些模型能够联合处理文本、图像、音频和视频。

主要亮点

  • 广泛的模型支持: 兼容 Qwen-Image、SD3.5、Wan2.2、LTX2.3 和 Qwen3-Omni。
  • 多样的算法支持: 实现了多种强化学习算法,包括 FlowGRPO、DiffusionNFT、Diffusion DPO 和 GSPO。
  • 高吞吐量: 在参考配置下,相比基于 diffusers 的实现,端到端吞吐量提升约 25%。
  • 硬件支持: 支持 NVIDIA GPU 和 Ascend NPU。

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • 项目