THUDM/slime

slime is an LLM post-training framework for RL Scaling.

它解決的問題

slime 是一個專為強化學習(Reinforcement Learning)擴展設計的大型語言模型(LLM)後訓練框架。它透過將高性能訓練與靈活的資料生成整合至單一、簡化的資料流程中,解決了管理分散的訓練器、滾動服務與代理框架所帶來的複雜性。

如何運作

slime 將 Megatron(用於訓練)與 SGLang(用於滾動/推論)相連接。它採用「直通」設計,讓使用者能直接使用上游引擎的原生參數,無需額外抽象層。系統由三個主要模組組成:

  • 訓練(Megatron):處理主要訓練流程,並將參數同步至滾動模組。
  • 滾動(SGLang + router):產生新資料,包括獎勵與驗證器輸出,可透過自訂函數擴展至多輪對話或工具呼叫。
  • 資料緩衝區:作為橋樑,管理提示初始化與生成樣本的流動。

適用對象

此框架適用於進行前沿模型(如 GLM、Qwen、DeepSeek 和 Llama 系列)大規模強化學習後訓練的研究人員與工程師,以及建構涉及沙盒、驗證器或跨模式互動的代理式強化學習工作流程的開發者。

主要特色

  • 已通過生產驗證:已用於 GLM 系列模型(GLM-4.5 至 GLM-5.3)的訓練。
  • 原生引擎整合:Megatron 與 SGLang 參數的直接直通,確保上游優化能立即應用。
  • 代理式彈性:支援複雜的資料生成工作流程,包括多代理系統、搜尋/RAG 及沙盒編碼代理,且無需修改訓練核心。
  • 進階部署功能:具備 PD(預填-解碼)拆分、增量權重同步以實現高效更新,並支援外部滾動引擎。
  • 工程嚴謹性:包含完整的 CI、GPU 端到端測試,以及專用的追蹤與效能分析工具。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案