verl-project/verl-omni
Multimodal RL training framework for diffusion & omni models
解决的问题
VeRL-Omni 解决了多模态生成模型在强化学习 (RL) 后训练阶段面临的特定挑战。与仅限文本的 LLM 不同,这些模型具有不同的 I/O 模式、计算特性和运行时瓶颈,需要专门的训练框架来确保稳定性和高吞吐量。
工作原理
基于 verl 框架构建,VeRL-Omni 为扩散模型、统一理解/生成模型以及全模态 (omni-modality) 模型的 RL 训练提供专用环境。它通过以下核心机制优化训练流水线:
- 高吞吐量 Rollouts:使用
vLLM-Omni作为 rollout 后端,加速多模态生成。 - 异步奖励服务 (Async Reward Serving):实现异步奖励计算和 HTTP 打分器,使奖励阶段与 rollout 阶段重叠,减少空闲时间。
- 模块化后端:支持可选的训练后端,如 VeOmni 和 FSDP2,并具有可组合的并行性 (USP/TP/DP) 以实现分布式扩展。
- 稳定性工具:包括 rollout 修正和确定性执行,以稳定扩散 RL 训练。
适用对象
专为从事图像、视频、音频或其组合(全模态)生成模型 RL 后训练的研究人员和工程师设计,例如使用 Qwen-Image、SD3.5 或 Wan2.2 的模型。
亮点
- 广泛的模型支持:兼容扩散生成器(图像/视频/音频)、统一多模态模型和全模态模型。
- 算法集成:支持广泛的 RL 算法,包括 FlowGRPO、Flow-DPPO、MixGRPO、DiffusionNFT 和 DPO。
- 性能提升:在特定设置下,端到端吞吐量比基于 diffusers 的实现高出约 25%。
- 硬件灵活性:同时支持标准 GPU 和 Ascend NPU。