AgentR1/Agent-R1

Agent-R1: Training Powerful LLM Agents with End-to-End Reinforcement Learning

What it solves

Agent-R1 解决了在多回合代理交互场景中,LLM 服务系统与分布式训练系统之间的鸿沟。它取代了单回合 RL 流程——将交互视为一长串提示‑响应序列——改为将每一次回合视为独立的步级马尔可夫决策过程(MDP)转移。这使得工具使用、环境状态和奖励分配能够更明确、精确地管理。

How it works

该框架运行在 rollout -> reward -> replay -> update 循环上。它把“代理步”视为基本交互单元,为每一次回合记录观察、动作、产生的反馈和奖励。

它使用分层架构,将训练栈与任务逻辑解耦:

  • AgentFlowBase:管理提示构建和模型调用。
  • AgentEnvLoop:将模型生成连接到环境的 reset/step 接口。
  • AgentEnv/ToolEnv:定义环境逻辑和工具注册。
  • BaseTool:可执行工具的标准接口(例如计算器或 API)。

Who it’s for

适用于需要通过强化学习提升决策和工具使用能力的 AI 研究者和开发者,尤其是构建多步 LLM 代理,应用于各种环境(如学术论文搜索、表格推理或网页购物)。

Highlights

  • 步级 MDP 表征:通过结构化数据存储转移,避免脆弱的文本重建。
  • 灵活上下文管理:允许环境根据任务需求截断、摘要或重写历史。
  • 算法‑系统解耦:使 rollout、奖励与策略目标能够独立演进。
  • 广泛算法支持:兼容 GRPO、PPO、REINFORCE、RLOO,以及 StepPO。