vime RL Framework 發布

vime RL Framework 發布

vLLM 已宣布發布 vime,這是一個開源的後訓練框架,旨在簡化並穩定大型語言模型 (LLM) 的強化學習 (RL)。透過將 slime 的訓練堆疊與 vLLM 的推理能力整合,vime 創建了一個統一的管線,使得分布式訓練和推理能夠在單一架構下可靠運行。

架構與設計

vime 基於 slime 範式採用三階段、解耦的訓練-推理設計,將標準的 rollout 後端替換為 vLLM。架構由三個主要組成部分組成:

  • Training (Megatron): 管理主訓練迴圈,處理參數更新,並將權重同步到 rollout 端。
  • Rollout (vLLM + Router): 執行推理採樣以產生伴隨獎勵或驗證信號的訓練樣本。
  • Data Buffer: 作為訓練與 rollout 之間的連接器,管理自訂 rollout 邏輯與提示注入。

關鍵技術能力

vime 針對各種模型架構與硬體配置進行穩定性與靈活性的設計:

  • Train-Inference Alignment: vime 在 Dense 與 Mixture-of-Experts (MoE) 場景中維持可控的 train_rollout_logprob_abs_diff。對於 MoE 模型,vime 實作 R3 (routing replay) 以進一步減少訓練與推理之間的不匹配。
  • Broad Model and Algorithm Support: 框架為包括 GRPOPPO 的 RL 演算法提供端到端範例與 CI 驗證的路徑,並支援如 Qwen3 Dense/MoEGLM-4.5 等模型。
  • Unified Hardware Abstraction: 訓練、rollout 資源與集群拓撲被統一抽象,使得 RL 管線能在 vLLM 生態系統演進時跨不同硬體後端重複使用。
  • Simplified Configuration: 系統繼承自 slime 與 Megatron 的參數慣例,使用 --vllm- 前綴將參數傳遞給 vLLM 端。

效能基準與驗證

硬體效率

在使用 Qwen3-30B-A3B 與 GRPO 在 dapo-math-17k 資料集 (8-GPU colocate) 上的測試中,vime 在較新硬體上展現顯著的效能提升:

  • GB200: 平均步驟時間約為 147 秒
  • H200: 平均步驟時間約為 252 秒
  • 比較: GB200 的端到端步驟速度約為 H200 的 1.72x

穩定性與對齊

  • Qwen3-4B (A100): 在 gsm8k 上使用 4 個訓練與 4 個推理非 colocate GPU 的 GRPO,vime 的 train_rollout_logprob_abs_diff 保持穩定於約 0.011,而基線則漂移至約 0.77
  • Qwen3-30B-A3B MoE (A100): 使用 4 個訓練與 4 個推理 GPU,啟用 R3 routing replay 後,logprob 差異從 0.019 減少至 0.013
  • GLM-4.5-Air (GB200): 在 dapo-math-17k 上使用 8-GPU colocate 的 GRPO,raw_reward 在 100 步驟內呈上升趨勢(平均約 0.56),而 train_rollout_logprob_abs_diff 保持在 0.02 到 0.03 之間穩定。

開發藍圖

vime 目前正專注於三個戰略領域進行演進:

  1. vLLM Integration: 採用 vLLM 的進階功能,包括 PD 分離、FP8、Router 及多模型服務。
  2. Hardware Expansion: 利用 vLLM 的硬體插件系統,將效率擴展至更多加速器與集群配置。
  3. Algorithmic Advancement: 開發完全非同步管線、用於多輪工具呼叫的 Agentic RL,以及支援如 VLMs 與 MoE 等新架構。

開始使用

vime 以 Apache 2.0 授權開源。使用者在配置 Megatron 訓練與 vLLM rollout 資源後,可透過 train.pytrain_async.py 啟動訓練。專案位於 GitHub 上,網址為 github.com/vllm-project/vime

Sources