THUDM/slime
slime is an LLM post-training framework for RL Scaling.
它解决了什么问题
slime 是一个专为强化学习(Reinforcement Learning)扩展设计的 LLM 后训练框架。它通过将高性能训练与灵活的数据生成统一到一个简洁的数据流中,解决了管理独立训练器、回放服务和代理框架所带来的复杂性问题。
它如何工作
slime 将 Megatron(用于训练)与 SGLang(用于回放/推理)连接起来。它采用“直通”设计,允许用户直接使用上游引擎的原生参数,而无需添加抽象层。该系统包含三个主要模块:
- 训练(Megatron):负责主要的训练流程,并将参数同步到回放模块。
- 回放(SGLang + 路由器):生成新数据,包括奖励和验证器输出,可通过自定义函数扩展以支持多轮对话或工具调用。
- 数据缓冲区:作为桥梁,管理提示初始化和生成样本的流动。
适用于谁
该框架适用于在前沿模型(如 GLM、Qwen、DeepSeek 和 Llama 系列)上进行大规模强化学习后训练的研究人员和工程师,以及构建涉及沙盒、验证器或多模态交互的代理式强化学习工作流的开发者。
主要亮点
- 生产环境验证:已在 GLM 系列模型(GLM-4.5 至 GLM-5.3)的训练中投入使用。
- 原生引擎集成:Megatron 和 SGLang 参数的直接直通,确保上游优化可立即生效。
- 代理灵活性:支持复杂的数据生成工作流,包括多代理系统、搜索/RAG 和沙盒化代码代理,且无需修改训练内核。
- 高级部署能力:支持 PD(预填充-解码)分离、增量权重同步以实现高效更新,并兼容外部回放引擎。
- 工程严谨性:包含全面的 CI、GPU 端到端测试,以及专门用于追踪和性能分析的工具。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目