vime RL Framework 發布
vime RL Framework 發布
vLLM 已宣布發布 vime,這是一個開源的後訓練框架,旨在簡化並穩定大型語言模型 (LLM) 的強化學習 (RL)。透過將 slime 的訓練堆疊與 vLLM 的推理能力整合,vime 創建了一個統一的管線,使得分布式訓練和推理能夠在單一架構下可靠運行。
架構與設計
vime 基於 slime 範式採用三階段、解耦的訓練-推理設計,將標準的 rollout 後端替換為 vLLM。架構由三個主要組成部分組成:
- Training (Megatron): 管理主訓練迴圈,處理參數更新,並將權重同步到 rollout 端。
- Rollout (vLLM + Router): 執行推理採樣以產生伴隨獎勵或驗證信號的訓練樣本。
- Data Buffer: 作為訓練與 rollout 之間的連接器,管理自訂 rollout 邏輯與提示注入。
關鍵技術能力
vime 針對各種模型架構與硬體配置進行穩定性與靈活性的設計:
- Train-Inference Alignment: vime 在 Dense 與 Mixture-of-Experts (MoE) 場景中維持可控的
train_rollout_logprob_abs_diff。對於 MoE 模型,vime 實作 R3 (routing replay) 以進一步減少訓練與推理之間的不匹配。 - Broad Model and Algorithm Support: 框架為包括 GRPO 與 PPO 的 RL 演算法提供端到端範例與 CI 驗證的路徑,並支援如 Qwen3 Dense/MoE 與 GLM-4.5 等模型。
- Unified Hardware Abstraction: 訓練、rollout 資源與集群拓撲被統一抽象,使得 RL 管線能在 vLLM 生態系統演進時跨不同硬體後端重複使用。
- Simplified Configuration: 系統繼承自 slime 與 Megatron 的參數慣例,使用
--vllm-前綴將參數傳遞給 vLLM 端。
效能基準與驗證
硬體效率
在使用 Qwen3-30B-A3B 與 GRPO 在 dapo-math-17k 資料集 (8-GPU colocate) 上的測試中,vime 在較新硬體上展現顯著的效能提升:
- GB200: 平均步驟時間約為 147 秒。
- H200: 平均步驟時間約為 252 秒。
- 比較: GB200 的端到端步驟速度約為 H200 的 1.72x。
穩定性與對齊
- Qwen3-4B (A100): 在 gsm8k 上使用 4 個訓練與 4 個推理非 colocate GPU 的 GRPO,vime 的
train_rollout_logprob_abs_diff保持穩定於約 0.011,而基線則漂移至約 0.77。 - Qwen3-30B-A3B MoE (A100): 使用 4 個訓練與 4 個推理 GPU,啟用 R3 routing replay 後,logprob 差異從 0.019 減少至 0.013。
- GLM-4.5-Air (GB200): 在 dapo-math-17k 上使用 8-GPU colocate 的 GRPO,
raw_reward在 100 步驟內呈上升趨勢(平均約 0.56),而train_rollout_logprob_abs_diff保持在 0.02 到 0.03 之間穩定。
開發藍圖
vime 目前正專注於三個戰略領域進行演進:
- vLLM Integration: 採用 vLLM 的進階功能,包括 PD 分離、FP8、Router 及多模型服務。
- Hardware Expansion: 利用 vLLM 的硬體插件系統,將效率擴展至更多加速器與集群配置。
- Algorithmic Advancement: 開發完全非同步管線、用於多輪工具呼叫的 Agentic RL,以及支援如 VLMs 與 MoE 等新架構。
開始使用
vime 以 Apache 2.0 授權開源。使用者在配置 Megatron 訓練與 vLLM rollout 資源後,可透過 train.py 或 train_async.py 啟動訓練。專案位於 GitHub 上,網址為 github.com/vllm-project/vime。