vime RL 框架发布
vime RL 框架发布
vLLM 已宣布发布 vime,这是一个开源的后训练框架,旨在简化和稳定大型语言模型(LLM)的强化学习(RL)。通过将 slime 的训练栈与 vLLM 的推理能力相结合,vime 创建了一个统一的管道,使得分布式训练和推理能够在单一架构下可靠运行。
架构与设计
vime 采用基于 slime 范式的三阶段解耦训练-推理设计,用 vLLM 替换标准的 rollout 后端。架构由三个主要组件组成:
- 训练 (Megatron): 管理主训练循环,处理参数更新,并将权重同步到 rollout 侧。
- Rollout (vLLM + Router): 执行推理采样以生成伴随奖励或验证器信号的训练样本。
- 数据缓冲区: 作为训练和 rollout 之间的连接器,管理自定义 rollout 逻辑和提示注入。
关键技术能力
vime 被设计用于在各种模型架构和硬件配置中提供稳定性和灵活性:
- 训练-推理对齐:vime 在 Dense 和 Mixture-of-Experts (MoE) 场景中保持可控的
train_rollout_logprob_abs_diff。对于 MoE 模型,vime 实现 R3 (路由重放) 以进一步最小化训练和推理之间的不匹配。 - 广泛的模型和算法支持:该框架为包括 GRPO 和 PPO 在内的 RL 算法提供端到端示例和 CI 验证的路径,并支持诸如 Qwen3 Dense/MoE 和 GLM-4.5 等模型。
- 统一的硬件抽象:训练、rollout 资源和集群拓扑被统一抽象,使得 RL 管道可以在 vLLM 生态系统演进过程中跨不同硬件后端重复使用。
- 简化配置:系统继承自 slime 和 Megatron 的参数约定,使用
--vllm-前缀将参数传递给 vLLM 侧。
性能基准和验证
硬件效率
在使用 Qwen3-30B-A3B 并在 dapo-math-17k 数据集(8-GPU colocate)上进行 GRPO 测试时,vime 在较新的硬件上展示了显著的性能提升:
- GB200: 平均步骤时间约为 147 秒。
- H200: 平均步骤时间约为 252 秒。
- 比较:GB200 的端到端步骤速度大约比 H200 快 1.72倍。
稳定性和对齐
- Qwen3-4B (A100): 在 gsm8k 上使用 GRPO,配备 4 个训练和 4 个推理非 colocate GPU,vime 的
train_rollout_logprob_abs_diff保持稳定,约为 0.011,而基线漂移到大约 0.77。 - Qwen3-30B-A3B MoE (A100): 配备 4 个训练和 4 个推理 GPU,启用 R3 路由重放后,logprob 差异从 0.019 减少到 0.013。
- GLM-4.5-Air (GB200): 在 dapo-math-17k 上使用 GRPO,配备 8-GPU colocate,
raw_reward在 100 步内呈上升趋势(均值约 0.56),而train_rollout_logprob_abs_diff保持在 0.02 到 0.03 之间稳定。
开发路线图
vime 目前正在围绕三个战略方向进行演进:
- vLLM 集成:采用高级 vLLM 特性,包括 PD 分离、FP8、Router 和多模型服务。
- 硬件扩展:利用 vLLM 的硬件插件系统,将效率扩展到更多加速器和集群配置。
- 算法进步:开发完全异步的管道,用于多轮工具调用的 Agentic RL,以及对 VLMs 和 MoE 等新架构的支持。
开始使用
vime 根据 Apache 2.0 许可证开源。用户在配置 Megatron 训练和 vLLM rollout 资源后,可以通过 train.py 或 train_async.py 启动训练。该项目在 GitHub 上可用,地址为 github.com/vllm-project/vime.