rllm-org/rllm
Democratizing Reinforcement Learning for LLMs
解决的问题
rLLM 简化了使用强化学习 (RL) 训练语言智能体的过程。它消除了为不同环境或训练后端重写智能体代码的摩擦,允许在各种基准测试和沙箱中将相同的智能体逻辑用于评估和训练。
工作原理
rLLM 使用一个流水线来运行智能体、收集轨迹、计算奖励并更新模型。它采用一个模型网关,通过 URL 路由会话透明地从 LLM 调用中捕获 token IDs 和 logprobs。这使得框架可以在无需更改智能体原始代码的情况下,将智能体交互结构化为 Episodes、Trajectories 和 Steps。该框架支持多种训练后端(如 verl、tinker 和 fireworks),并可以在各种沙箱(如 Docker、Daytona 或 Modal)中运行智能体,并利用快照和热池加速来降低成本。
适用对象
需要使用 GRPO、REINFORCE 和 RLOO 等 RL 方法来训练和评估智能体程序的 AI 研究人员和工业团队。
亮点
- 后端无关性: 通过单个标志即可在分布式多 GPU 训练 (verl)、单机训练 (tinker) 和 Fireworks 平台之间切换。
- 广泛的基准测试集成: 包括涵盖数学、代码、问答和智能体任务(例如 SWE-bench、AIME)的 60 多个集成基准测试。
- 灵活的 Harness: 支持 10 多个 CLI harness,并允许用户使用简单的装饰器包装自己的智能体(例如 LangGraph 或 OpenAI Agents SDK)。
- 沙箱支持: 与多种沙箱环境兼容,以确保安全且可扩展的展开。
- 经过验证的结果: 已用于创建 DeepScaleR、DeepCoder 和 DeepSWE 等最先进的开源模型。
相关
- 项目
- 项目
- 项目
- 项目
- 项目