RUC-NLPIR/ARPO

[ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)

解決的問題

ARPO 與 AEPO 是專為提升大型語言模型(LLM)代理在多回合互動與工具使用表現而設計的強化學習(RL)演算法。它們特別針對 LLM 接收外部工具回饋時產生的高不確定性(熵),此類不確定性常會打亂模型的推理過程,導致各階段行為難以對齊。

工作原理

ARPO(代理強化策略最佳化)

ARPO 鼓勵策略模型在熵較高的工具呼叫回合中自適應地進行「分支取樣」。這使得模型在最不確定時能更有效地探索多種潛在推理路徑,進而提升工具使用行為的一致性。

AEPO(代理熵平衡策略最佳化)

AEPO 在此基礎上進一步平衡兩個階段的熵:

  • 回放階段:使用動態熵平衡回放機制分配取樣預算,並施加懲罰以防止在連續高熵步驟中過度分支。
  • 更新階段:採用熵平衡策略最佳化,透過停止梯度操作(熵剪裁平衡機制)保留高熵標記的梯度,並利用熵感知優勢估計,優先在高不確定性標記上進行學習。

適用對象

本專案適用於訓練基於 LLM 的代理(如 Qwen 或 Llama 模型)在多回合環境中執行複雜推理與自主工具互動的 AI 研究人員與開發者。

主要亮點

  • 性能提升:在 GAIA 和 HLE 等基準測試中取得高分(例如,Qwen3-14B 在 GAIA 上達到 61.2%)。
  • 高效性:相比 GRPO,訓練過程中所需的工具呼叫次數顯著減少。
  • 優化能力:包含工具呼叫加速與記憶體優化,可在單一節點上以 128 的批次大小於 10 分鐘內完成 14B 模型每步的訓練。
  • 完整資源:提供完整的程式碼庫、SFT 與 RL 資料集,以及從 3B 到 32B 參數的預訓練模型檢查點。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案