VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架

VeRL-Omni: 用于扩散和全模态模型的强化学习训练框架

vLLM 已宣布 VeRL-Omni 的预发布,这是一个专为多模态生成模型设计的通用强化学习 (RL) 后训练框架。基于 verlvllm-omni 构建,VeRL-Omni 解决了非自回归和全模态模型(如扩散 Transformer 和统一理解与生成架构)的 RL 训练独特挑战。

多模态强化学习的技术挑战

  • 架构扩展: 框架将 RL 能力扩展到扩散 Transformer 骨干网络(例如 Qwen-Image)、混合 AR-DiT 架构(例如 Qwen-Omni)以及统一模型(例如 BAGEL、HunyuanImage3.0)。
  • 异构 Rollout 管道: 与基于文本的 RL 不同,多模态 Rollout 是连续潜在空间中的去噪轨迹。这些管道通常涉及多个组件,例如文本编码器、扩散 Transformer (DiT) 和变分自编码器 (VAE)。
  • 工作负载调度: 多模态 RL 需要协调复杂的工作流程,其中奖励函数往往是多模态模型本身(例如 VLM 评判者或 OCR 评分器),并且生成 Rollout 通常表现出比文本生成更高的内存峰值。

关锬框架特性

  • 高效多模态 Rollout: 通过集成 vLLM-Omni,框架利用高吞吐异步服务进行多模态生成,采用逐步连续批处理和嵌入缓存来优化效率。
  • 灵活的奖励引擎: 系统同时支持基于规则和基于模型的奖励(例如 VLM-as-judge)。vLLM 用于高效的奖励模型推理,奖励计算与 Rollout 和训练过程重叠以减少延迟。
  • 模块化训练后端: 框架包含多种训练器——例如 DiffusersFSDP、Megatron 和 VeOmni——内置了针对扩散和全模态模型的优化,支持包括 FSDP、USP 和 TP 的并行策略。
  • 硬件兼容性: VeRL-Omni 同时支持 NVIDIA GPU 和 Ascend NPU。

支持的模型和算法

模型 架构 模态 算法 状态
Qwen-Image DiT 文本 → 图像 FlowGRPO, MixGRPO, GRPO-Guard 已发布
BAGEL 统一理解 + 生成 文本 + 图像 FlowGRPO PR 就绪
Qwen3-Omni-Thinker AR 文本 / 图像 / 视频 / 音频 GSPO PR 就绪
Wan2.2 DiT 文本 → 视频 DanceGRPO 进行中
SD3.5 DiT 文本 → 图像 DPO 进行中
HunyuanImage-3.0 统一理解 + 生成 文本 + 图像 MixGRPO, SRPO 计划中

FlowGRPO 实现与性能

VeRL-Omni 实现了 FlowGRPO,这是一种用于流匹配模型的在线策略方法。训练工作流程包括四个阶段:rollout 生成(收集轨迹和图像)、奖励模型评分、使用 CLIP-style 损失进行策略优化,以及训练器到 rollout 工作器的定期权重同步。

性能基准测试

在使用 NVIDIA H800 GPU 对 Qwen-Image 进行 LoRA 微调以完成 OCR 奖励任务的测试中,框架展示了以下吞吐量:

  • 共置训练: 每 GPU 每秒 0.305 张图像,每步耗时 420 秒。
  • 异步奖励: 每 GPU 每秒 0.280 张图像,每步耗时 360 秒。将奖励模型移至专用 GPU 可使每步的墙钟时间降低约 14%。

在 4 × NVIDIA H200 GPU 上对 Qwen-Image(非 CFG)进行全模型微调时,框架达到了 0.510 images/GPU/s,每步约 250 秒。

未来路线图

  • 扩展模型支持: 添加更多用于图像、视频和音频生成的开源扩散和全模态模型。
  • 高级算法: 集成新的 RL 算法,例如 DiffusionNFT。
  • 完全异步 RL: 开发跨 actor、rollout 和 reward 的端到端异步管道,以提高 GPU/NPU 利用率。
  • vLLM-Omni 协同优化: 通过先进的并行、量化和批处理进一步加速 rollout。
  • 优化的训练器: 基于 Megatron-core 和 VeOmni 发布更多训练引擎。
  • 硬件扩展: 加固 Ascend NPU 路径并添加更多硬件后端。

Sources