VeRL-Omni v0.2.20 发布说明 / 新特性

VeRL-Omni v0.2.0 为全模态强化学习 (RL) 建立了生产级的基石,重点在于提高扩散 (diffusion) RL 的吞吐量并稳定全模态模型的训练栈。本次发布的核心在于两大主要进展:实现了扩散 RL 的请求级批处理 (request-level batching) 以及引入了可复用的全模态训练架构。

通过请求级批处理实现更快的扩散 RL

VeRL-Omni v0.2.0 通过摒弃串行执行,显著降低了扩散 RL 的 rollout 延迟。在之前的版本中,扩散 rollout 经常受限于串行的 DiT 前向传播,导致 GPU 利用率低下。

技术改进

  • 请求级批处理 (Request-Level Batching): vLLM-Omni 现在将兼容的请求打包进更大的 transformer 前向传播中,而不是通过串行循环进行处理。这成为了支持的扩散适配器 (diffusion adapters) 的默认 rollout 路径,允许通过调度参数进行显式的并发控制。
  • V1 Trainer 集成: 扩散 RL 现在利用 V1 trainer 路径,使其与 VeRL-Omni 中使用的现代 trainer 架构保持一致,并为未来 rollout 与训练执行的解耦提供了可能。
  • 正确性修复: 更新解决了确保策略一致性的关键领域,包括请求批处理后的扩散 log-probs、异步 rollout 语义、rank-local LoRA 权重更新路径以及 rollout-correction hooks。

性能基准测试

使用 Qwen-Image LoRA OCR 配方,转向请求级打包 (request-level packing) 将 GPU 利用率从约 80% 提高到了 100%。这使得孤立生成时间减少了 52%,从 226 秒降至 108 秒。

对于在 512 px 下使用 True-CFG 的 Qwen-Image LoRA,建议的 max_num_seqs 调节范围是 8 到 32。由于内存占用较轻,SD3.5 支持更高的并发,其 max_num_seqs 最高可达 256。

稳定的全模态训练架构

VeRL-Omni v0.2.0 从特定模型的集成转向了可复用的全模态训练栈。这使得多模态自回归训练可以更自然地集成到现有的 trainer、adapter 和 rollout 结构中。

全模态训练栈

  • V1 Trainer 架构: 全模态配方现在受益于更清晰的 worker 编排和标准配置覆盖,从而提高了与 vLLM-Omni rollouts 的一致性。
  • 可复用的全模态模型适配器 (Omni Model Adapter): 一个共享接口 (OmniModelBase) 处理模型设置、处理器配置、可训练阶段选择、FSDP 准备以及 rollout 对齐。这消除了为每个新架构进行一次性布线的需求。
  • 模块化调用流: main_omni.py 入口点将在线全模态任务导向 verl PPO V1 路径。PPO trainer 管理 RL 循环(rollout 调度、优势值计算和策略更新),而特定的 OmniModelBase 适配器(例如 Qwen3OmniThinkerAdapter)处理模型特定的逻辑,例如剥离非活跃模块并将前向传播重定向到目标组件。

MMK12 基准测试结果

新路径的稳定性通过 MMK12 锚点配方得到了验证,该配方在 4 x H800 80GB GPU 上使用 GSPO 和 LoRA (rank 32) 在 K12 视觉数学推理 (image-to-text) 上训练 Qwen3-Omni。该设置实现了:

  • 验证集奖励 (Validation Reward): 0.833
  • Actor-Rollout Pearson 相关系数: 0.998
  • GPU 显存占用: 约 59 GB

扩展的模型与算法支持

VeRL-Omni v0.2.0 扩展了其对各种扩散模型和全模态模型的支持矩阵:

Model / Family Modality Algorithm / Recipe Key Update
LTX2.3 Text $\to$ Video + Audio FlowGRPO 增加了带有 CLAP 和 ImageBind 奖励的 text-to-video+audio 训练。
Qwen-Image-Edit Text + Image $\to$ Image FlowGRPO 增加了图像编辑数据准备和训练接口。
BAGEL Text + Image FlowGRPO 增加了带有 OCR 和 PickScore 奖励的全参数和 LoRA 配方。
SD3.5 + DiNa-LRM Text $\to$ Image FlowGRPO 实现了潜空间奖励模型 (latent reward model) 来为干净的扩散潜变量进行评分,从而绕过 VAE decode。
Flow-DPPO Text/Image $\to$ Image Flow-DPPO Flow-DPPO 是一种用于 Qwen-Image 风格扩散 RL 的新策略优化配方。
Wan2.2 Text $ o$ Video DanceGRPO 增加了视频生成 RL 配方覆盖。

此外,本次发布还包括 Ascend NPU Dockerfiles 和安装指南。

未来路线图

VeRL-Omni 的后续开发计划包括:

  • 实现完全异步训练以优化全模态模型。
  • 扩展支持至 MiniMax-H3 和 MiniCPM-o 等模型,以及 OPD/M-OPD 等 trainer。
  • 通过批处理、TQ 和 V1 trainer 集成,提高视频扩散训练效率。
  • 强化 rollout 代码以支持扩散和全模态上下文下的异步训练。
  • 开发支持涉及多轮和多阶段生成的智能体 (agentic) RL。

Sources

相关

  • Dispatch
  • 项目
  • Dispatch
  • Dispatch
  • Dispatch