NVIDIA-NeMo/ProRL-Agent-Server

Agentic RL on Any Harness at Scale

解决的问题

Polar 是一个为真实世界代理工具链设计的强化学习(RL)回放框架。它通过提供「回放即服务」(Rollout-as-a-Service)架构,解决了多轮 LLM 代理非同步强化学习训练的可扩展性问题,使开发者无需修改现有代理工具链即可生成轨迹(回放)。

工作原理

Polar 作为一个分布式服务器系统运行。中央回放服务器负责管理和分发请求至分布式网关节点。这些节点异步准备运行时环境,执行代理,构建轨迹并进行评估。系统在代理执行进程与推理服务器(如 vLLM 或 SGLang)之间设置代理,以处理通信,使系统与训练框架无关,并兼容多种训练框架。

适用人群

使用 RL 训练 LLM 代理的研究人员和开发者,需要一种可扩展的方式,在不同环境和工具链之间生成和评估轨迹,而无需更改代理的核心代码。

核心亮点

  • 工具链无关:无需代码修改,即可将现有代理工具链集成为 RL 就绪环境。
  • 可扩展架构:通过并行回放预处理和运行时池化,优化 GPU 使用效率。
  • 训练框架无关:通过 HTTP 服务器边界,兼容任意训练框架。
  • 可观测性:提供专用仪表板用于监控和健康检查。
  • 广泛支持:兼容 vLLM 和 SGLang 推理服务器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目