VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架
VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架
vLLM 已宣布 VeRL-Omni 的预发布,这是一个专为多模态生成模型设计的通用强化学习 (RL) 后训练框架。基于 verl 和 vllm-omni 构建,VeRL-Omni 解决了非自回归和全模态模型(如扩散 Transformer 和统一理解与生成架构)的 RL 训练独特挑战。
多模态强化学习的技术挑战
- 架构扩展: 框架将 RL 能力扩展到扩散 Transformer 骨干网络(例如 Qwen-Image)、混合 AR-DiT 架构(例如 Qwen-Omni)以及统一模型(例如 BAGEL、HunyuanImage3.0)。
- 异构 Rollout 管道: 与基于文本的 RL 不同,多模态 Rollout 是连续潜在空间中的去噪轨迹。这些管道通常涉及多个组件,例如文本编码器、扩散 Transformer (DiT) 和变分自编码器 (VAE)。
- 工作负载调度: 多模态 RL 需要协调复杂的工作流程,其中奖励函数往往是多模态模型本身(例如 VLM 评判者或 OCR 评分器),并且生成 Rollout 通常表现出比文本生成更高的内存峰值。
关锬框架特性
- 高效多模态 Rollout: 通过集成 vLLM-Omni,框架利用高吞吐异步服务进行多模态生成,采用逐步连续批处理和嵌入缓存来优化效率。
- 灵活的奖励引擎: 系统同时支持基于规则和基于模型的奖励(例如 VLM-as-judge)。vLLM 用于高效的奖励模型推理,奖励计算与 Rollout 和训练过程重叠以减少延迟。
- 模块化训练后端: 框架包含多种训练器——例如 DiffusersFSDP、Megatron 和 VeOmni——内置了针对扩散和全模态模型的优化,支持包括 FSDP、USP 和 TP 的并行策略。
- 硬件兼容性: VeRL-Omni 同时支持 NVIDIA GPU 和 Ascend NPU。
支持的模型和算法
| 模型 | 架构 | 模态 | 算法 | 状态 |
|---|---|---|---|---|
| Qwen-Image | DiT | 文本 → 图像 | FlowGRPO, MixGRPO, GRPO-Guard | 已发布 |
| BAGEL | 统一理解 + 生成 | 文本 + 图像 | FlowGRPO | PR 就绪 |
| Qwen3-Omni-Thinker | AR | 文本 / 图像 / 视频 / 音频 | GSPO | PR 就绪 |
| Wan2.2 | DiT | 文本 → 视频 | DanceGRPO | 进行中 |
| SD3.5 | DiT | 文本 → 图像 | DPO | 进行中 |
| HunyuanImage-3.0 | 统一理解 + 生成 | 文本 + 图像 | MixGRPO, SRPO | 计划中 |
FlowGRPO 实现与性能
VeRL-Omni 实现了 FlowGRPO,这是一种用于流匹配模型的在线策略方法。训练工作流程包括四个阶段:rollout 生成(收集轨迹和图像)、奖励模型评分、使用 CLIP-style 损失进行策略优化,以及训练器到 rollout 工作器的定期权重同步。
性能基准测试
在使用 NVIDIA H800 GPU 对 Qwen-Image 进行 LoRA 微调以完成 OCR 奖励任务的测试中,框架展示了以下吞吐量:
- 共置训练: 每 GPU 每秒 0.305 张图像,每步耗时 420 秒。
- 异步奖励: 每 GPU 每秒 0.280 张图像,每步耗时 360 秒。将奖励模型移至专用 GPU 可使每步的墙钟时间降低约 14%。
在 4 × NVIDIA H200 GPU 上对 Qwen-Image(非 CFG)进行全模型微调时,框架达到了 0.510 images/GPU/s,每步约 250 秒。
未来路线图
- 扩展模型支持: 添加更多用于图像、视频和音频生成的开源扩散和全模态模型。
- 高级算法: 集成新的 RL 算法,例如 DiffusionNFT。
- 完全异步 RL: 开发跨 actor、rollout 和 reward 的端到端异步管道,以提高 GPU/NPU 利用率。
- vLLM-Omni 协同优化: 通过先进的并行、量化和批处理进一步加速 rollout。
- 优化的训练器: 基于 Megatron-core 和 VeOmni 发布更多训练引擎。
- 硬件扩展: 加固 Ascend NPU 路径并添加更多硬件后端。