ZJU-REAL/SDAR
Official code for "Self-Distilled Agentic Reinforcement Learning"
解决的问题
SDAR 通过将智能体强化学习(Agentic RL)与在线策略自我蒸馏(OPSD)相结合,解决了在复杂环境中提升基于大语言模型(LLM)的智能体性能的挑战。该框架可广泛提升智能体在导航、购物和搜索等任务中的能力,而这些任务中标准的强化学习基线方法往往表现不佳。
工作原理
SDAR 实现了一种自我蒸馏型智能体强化学习方法,采用门控机制。该机制使智能体能够从自身成功的轨迹中学习,并通过自我蒸馏过程不断进化其技能。该框架支持多种强化学习方法,包括 GRPO、RLSD 和 Skill-SD,并兼容 Qwen3 和 Qwen2.5 等模型。
适用人群
本项目专为从事智能体强化学习的 AI 研究人员和开发者设计,特别是那些希望实现或实验自我蒸馏技术以提升 LLM 智能体在交互式环境中的性能的研究者。
主要亮点
- 统一框架:首个开源的将 Agentic RL 与 OP(S)D 统一的框架。
- 广泛环境支持:兼容 ALFWorld、WebShop 和 Search-QA 等环境。
- 广泛方法支持:支持多种训练方法,包括 OPSD、GRPO 以及专有的 SDAR 方法。
- 丰富的研究生态:已成为众多后续研究工作的基础,如 TASPO、AHEAD 和 AgentOPSD。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目