THUDM/slime

slime is an LLM post-training framework for RL Scaling.

它解决了什么问题

slime 是一个专为强化学习(Reinforcement Learning)扩展设计的 LLM 后训练框架。它通过将高性能训练与灵活的数据生成统一到一个简洁的数据流中,解决了管理独立训练器、回放服务和代理框架所带来的复杂性问题。

它如何工作

slime 将 Megatron(用于训练)与 SGLang(用于回放/推理)连接起来。它采用“直通”设计,允许用户直接使用上游引擎的原生参数,而无需添加抽象层。该系统包含三个主要模块:

  • 训练(Megatron):负责主要的训练流程,并将参数同步到回放模块。
  • 回放(SGLang + 路由器):生成新数据,包括奖励和验证器输出,可通过自定义函数扩展以支持多轮对话或工具调用。
  • 数据缓冲区:作为桥梁,管理提示初始化和生成样本的流动。

适用于谁

该框架适用于在前沿模型(如 GLM、Qwen、DeepSeek 和 Llama 系列)上进行大规模强化学习后训练的研究人员和工程师,以及构建涉及沙盒、验证器或多模态交互的代理式强化学习工作流的开发者。

主要亮点

  • 生产环境验证:已在 GLM 系列模型(GLM-4.5 至 GLM-5.3)的训练中投入使用。
  • 原生引擎集成:Megatron 和 SGLang 参数的直接直通,确保上游优化可立即生效。
  • 代理灵活性:支持复杂的数据生成工作流,包括多代理系统、搜索/RAG 和沙盒化代码代理,且无需修改训练内核。
  • 高级部署能力:支持 PD(预填充-解码)分离、增量权重同步以实现高效更新,并兼容外部回放引擎。
  • 工程严谨性:包含全面的 CI、GPU 端到端测试,以及专门用于追踪和性能分析的工具。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目