ZJU-REAL/SDAR

Official code for "Self-Distilled Agentic Reinforcement Learning"

何を解決するか

SDARは、Agentic Reinforcement Learning (RL) と On-Policy Self-Distillation (OPSD) を統合することで、複雑な環境におけるLLMベースのエージェントのパフォーマンス向上という課題に対処します。標準的なRLベースラインがしばしば苦戦するナビゲーション、ショッピング、検索などのさまざまなタスクにおいて、エージェントの能力を向上させるフレームワークを提供します。

動作方法

SDARは、ゲーティングメカニズムを用いた自己蒸留型エージェント強化学習手法を実装しています。エージェントが自身の成功した経路から学び、自己蒸留のプロセスを通じてスキルを進化させることを可能にします。このフレームワークはGRPO、RLSD、Skill-SDなどの複数のRL手法をサポートしており、Qwen3やQwen2.5などのモデルとも互換性があります。

対象ユーザー

このプロジェクトは、特に自己蒸留技術を実装または実験して、インタラクティブ環境におけるLLMエージェントのパフォーマンスを向上させたいと考えているAI研究者や開発者向けに設計されています。

主な特徴

  • 統合型フレームワーク: Agentic RLとOP(S)Dを統合した最初のオープンソースフレームワーク。
  • 広範な環境対応: ALFWorld、WebShop、Search-QAと互換性があります。
  • 広範な手法対応: OPSD、GRPO、および独自のSDAR手法を含むさまざまな学習手法をサポート。
  • 包括的な研究エコシステム: TASPO、AHEAD、AgentOPSDなど、多数の後続研究の基盤となっています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト