ZJU-REAL/SDAR

Official code for "Self-Distilled Agentic Reinforcement Learning"

解決的問題

SDAR 透過整合智能體強化學習(Agentic RL)與在線策略自我蒸餾(OPSD),解決了在複雜環境中提升基於大語言模型(LLM)智能體性能的挑戰。該框架可廣泛提升智能體在導航、購物與搜尋等任務中的能力,而這些任務中標準的強化學習基線方法往往表現不佳。

工作原理

SDAR 實現了一種自我蒸餾型智能體強化學習方法,採用門控機制。該機制使智能體能從自身成功的軌跡中學習,並透過自我蒸餾過程不斷進化其技能。該框架支援多種強化學習方法,包括 GRPO、RLSD 與 Skill-SD,並相容 Qwen3 與 Qwen2.5 等模型。

適用對象

本專案專為從事智能體強化學習的 AI 研究人員與開發者設計,特別是那些希望實現或實驗自我蒸餾技術,以提升 LLM 智能體在互動式環境中性能的研究者。

主要亮點

  • 統一框架:首個開源的整合 Agentic RL 與 OP(S)D 的框架。
  • 廣泛環境支援:相容 ALFWorld、WebShop 與 Search-QA 等環境。
  • 廣泛方法支援:支援多種訓練方法,包括 OPSD、GRPO 以及專有的 SDAR 方法。
  • 豐富的研究生態:已成為眾多後續研究工作的基礎,如 TASPO、AHEAD 與 AgentOPSD。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案