RUC-NLPIR/ARPO
[ICLR 2026] Agentic Reinforced Policy Optimization (ARPO)
解決的問題
ARPO 與 AEPO 是專為提升大型語言模型(LLM)代理在多回合互動與工具使用表現而設計的強化學習(RL)演算法。它們特別針對 LLM 接收外部工具回饋時產生的高不確定性(熵),此類不確定性常會打亂模型的推理過程,導致各階段行為難以對齊。
工作原理
ARPO(代理強化策略最佳化)
ARPO 鼓勵策略模型在熵較高的工具呼叫回合中自適應地進行「分支取樣」。這使得模型在最不確定時能更有效地探索多種潛在推理路徑,進而提升工具使用行為的一致性。
AEPO(代理熵平衡策略最佳化)
AEPO 在此基礎上進一步平衡兩個階段的熵:
- 回放階段:使用動態熵平衡回放機制分配取樣預算,並施加懲罰以防止在連續高熵步驟中過度分支。
- 更新階段:採用熵平衡策略最佳化,透過停止梯度操作(熵剪裁平衡機制)保留高熵標記的梯度,並利用熵感知優勢估計,優先在高不確定性標記上進行學習。
適用對象
本專案適用於訓練基於 LLM 的代理(如 Qwen 或 Llama 模型)在多回合環境中執行複雜推理與自主工具互動的 AI 研究人員與開發者。
主要亮點
- 性能提升:在 GAIA 和 HLE 等基準測試中取得高分(例如,Qwen3-14B 在 GAIA 上達到 61.2%)。
- 高效性:相比 GRPO,訓練過程中所需的工具呼叫次數顯著減少。
- 優化能力:包含工具呼叫加速與記憶體優化,可在單一節點上以 128 的批次大小於 10 分鐘內完成 14B 模型每步的訓練。
- 完整資源:提供完整的程式碼庫、SFT 與 RL 資料集,以及從 3B 到 32B 參數的預訓練模型檢查點。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案