VeRL-Omni v0.2.20 发布说明 / 新特性
VeRL-Omni v0.2.0 为全模态强化学习 (RL) 建立了生产级的基石,重点在于提高扩散 (diffusion) RL 的吞吐量并稳定全模态模型的训练栈。本次发布的核心在于两大主要进展:实现了扩散 RL 的请求级批处理 (request-level batching) 以及引入了可复用的全模态训练架构。
通过请求级批处理实现更快的扩散 RL
VeRL-Omni v0.2.0 通过摒弃串行执行,显著降低了扩散 RL 的 rollout 延迟。在之前的版本中,扩散 rollout 经常受限于串行的 DiT 前向传播,导致 GPU 利用率低下。
技术改进
- 请求级批处理 (Request-Level Batching): vLLM-Omni 现在将兼容的请求打包进更大的 transformer 前向传播中,而不是通过串行循环进行处理。这成为了支持的扩散适配器 (diffusion adapters) 的默认 rollout 路径,允许通过调度参数进行显式的并发控制。
- V1 Trainer 集成: 扩散 RL 现在利用 V1 trainer 路径,使其与 VeRL-Omni 中使用的现代 trainer 架构保持一致,并为未来 rollout 与训练执行的解耦提供了可能。
- 正确性修复: 更新解决了确保策略一致性的关键领域,包括请求批处理后的扩散 log-probs、异步 rollout 语义、rank-local LoRA 权重更新路径以及 rollout-correction hooks。
性能基准测试
使用 Qwen-Image LoRA OCR 配方,转向请求级打包 (request-level packing) 将 GPU 利用率从约 80% 提高到了 100%。这使得孤立生成时间减少了 52%,从 226 秒降至 108 秒。
对于在 512 px 下使用 True-CFG 的 Qwen-Image LoRA,建议的 max_num_seqs 调节范围是 8 到 32。由于内存占用较轻,SD3.5 支持更高的并发,其 max_num_seqs 最高可达 256。
稳定的全模态训练架构
VeRL-Omni v0.2.0 从特定模型的集成转向了可复用的全模态训练栈。这使得多模态自回归训练可以更自然地集成到现有的 trainer、adapter 和 rollout 结构中。
全模态训练栈
- V1 Trainer 架构: 全模态配方现在受益于更清晰的 worker 编排和标准配置覆盖,从而提高了与 vLLM-Omni rollouts 的一致性。
- 可复用的全模态模型适配器 (Omni Model Adapter): 一个共享接口 (
OmniModelBase) 处理模型设置、处理器配置、可训练阶段选择、FSDP 准备以及 rollout 对齐。这消除了为每个新架构进行一次性布线的需求。 - 模块化调用流:
main_omni.py入口点将在线全模态任务导向 verl PPO V1 路径。PPO trainer 管理 RL 循环(rollout 调度、优势值计算和策略更新),而特定的OmniModelBase适配器(例如Qwen3OmniThinkerAdapter)处理模型特定的逻辑,例如剥离非活跃模块并将前向传播重定向到目标组件。
MMK12 基准测试结果
新路径的稳定性通过 MMK12 锚点配方得到了验证,该配方在 4 x H800 80GB GPU 上使用 GSPO 和 LoRA (rank 32) 在 K12 视觉数学推理 (image-to-text) 上训练 Qwen3-Omni。该设置实现了:
- 验证集奖励 (Validation Reward): 0.833
- Actor-Rollout Pearson 相关系数: 0.998
- GPU 显存占用: 约 59 GB
扩展的模型与算法支持
VeRL-Omni v0.2.0 扩展了其对各种扩散模型和全模态模型的支持矩阵:
| Model / Family | Modality | Algorithm / Recipe | Key Update |
|---|---|---|---|
| LTX2.3 | Text $\to$ Video + Audio | FlowGRPO | 增加了带有 CLAP 和 ImageBind 奖励的 text-to-video+audio 训练。 |
| Qwen-Image-Edit | Text + Image $\to$ Image | FlowGRPO | 增加了图像编辑数据准备和训练接口。 |
| BAGEL | Text + Image | FlowGRPO | 增加了带有 OCR 和 PickScore 奖励的全参数和 LoRA 配方。 |
| SD3.5 + DiNa-LRM | Text $\to$ Image | FlowGRPO | 实现了潜空间奖励模型 (latent reward model) 来为干净的扩散潜变量进行评分,从而绕过 VAE decode。 |
| Flow-DPPO | Text/Image $\to$ Image | Flow-DPPO | Flow-DPPO 是一种用于 Qwen-Image 风格扩散 RL 的新策略优化配方。 |
| Wan2.2 | Text $ o$ Video | DanceGRPO | 增加了视频生成 RL 配方覆盖。 |
此外,本次发布还包括 Ascend NPU Dockerfiles 和安装指南。
未来路线图
VeRL-Omni 的后续开发计划包括:
- 实现完全异步训练以优化全模态模型。
- 扩展支持至 MiniMax-H3 和 MiniCPM-o 等模型,以及 OPD/M-OPD 等 trainer。
- 通过批处理、TQ 和 V1 trainer 集成,提高视频扩散训练效率。
- 强化 rollout 代码以支持扩散和全模态上下文下的异步训练。
- 开发支持涉及多轮和多阶段生成的智能体 (agentic) RL。
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch