verl-project/verl-omni
Multimodal RL training framework for diffusion & omni models
它解决了什么问题
VeRL-Omni 为多模态生成模型的强化学习(RL)后训练提供了一个稳定且高性能的框架。它解决了多模态强化学习特有的挑战——例如复杂的输入/输出模式、计算瓶颈以及高效采样生成的需求——这些挑战与仅文本的大型语言模型(LLM)训练有显著不同。
它如何工作
该框架基于 verl 构建,并集成了多种优化以加速强化学习流程:
- 快速采样: 使用
vLLM-Omni后端,通过采样路由、批处理和嵌入缓存优化生成过程。 - 异步奖励服务: 支持多种奖励模型(例如 HPSv3、GenRM-OCR),并通过异步计算将奖励计算阶段与采样阶段重叠。
- 模块化后端: 提供可选的训练后端,如 VeOmni 和 FSDP2,支持组合并行(USP/TP/DP)以实现分布式训练。
- 稳定性机制: 实现采样修正,跳过 logP 重新计算,确保扩散强化学习流程更快且更稳定。
适用人群
致力于扩散模型(图像、视频、音频)和多模态模型后训练对齐的研究人员和开发者,这些模型能够联合处理文本、图像、音频和视频。
主要亮点
- 广泛的模型支持: 兼容 Qwen-Image、SD3.5、Wan2.2、LTX2.3 和 Qwen3-Omni。
- 多样的算法支持: 实现了多种强化学习算法,包括 FlowGRPO、DiffusionNFT、Diffusion DPO 和 GSPO。
- 高吞吐量: 在参考配置下,相比基于 diffusers 的实现,端到端吞吐量提升约 25%。
- 硬件支持: 支持 NVIDIA GPU 和 Ascend NPU。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- 项目