RUC-NLPIR/ARPO

[ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

解决的问题

ARPO 和 AEPO 是专为提升大语言模型(LLM)代理在多轮交互和工具使用中的表现而设计的强化学习(RL)算法。它们特别针对 LLM 接收外部工具反馈时产生的高不确定性(熵),这种不确定性常会扰乱模型的推理过程,导致难以对齐各步骤的行为。

工作原理

ARPO(代理强化策略优化)

ARPO 鼓励策略模型在熵较高的工具调用轮次中自适应地进行「分支采样」。这使得模型在最不确定时能更有效地探索多种潜在推理路径,从而提升工具使用行为的一致性。

AEPO(代理熵平衡策略优化)

AEPO 在此基础上进一步平衡两个阶段的熵:

  • 回放阶段:使用动态熵平衡回放机制分配采样预算,并施加惩罚以防止在连续高熵步骤中过度分支。
  • 更新阶段:采用熵平衡策略优化,通过停止梯度操作(熵剪裁平衡机制)保留高熵标记的梯度,并利用熵感知的优势估计,优先在高不确定性标记上进行学习。

适用人群

本项目适用于训练基于 LLM 的代理(如 Qwen 或 Llama 模型)在多轮环境中执行复杂推理和自主工具交互的 AI 研究人员和开发者。

主要亮点

  • 性能提升:在 GAIA 和 HLE 等基准测试中取得高分(例如,Qwen3-14B 在 GAIA 上达到 61.2%)。
  • 高效性:相比 GRPO,训练过程中所需的工具调用次数显著减少。
  • 优化能力:包含工具调用加速和内存优化,可在单节点上以 128 的批量大小在 10 分钟内完成 14B 模型每步的训练。
  • 全面资源:提供完整的代码库、SFT 和 RL 数据集,以及从 3B 到 32B 参数的预训练模型检查点。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目