ZJU-REAL/SDAR

Official code for "Self-Distilled Agentic Reinforcement Learning"

해결하는 문제

SDAR는 Agentic 강화학습(Reinforcement Learning, RL)과 온폴리시 자기증류(On-Policy Self-Distillation, OPSD)를 통합함으로써, 복잡한 환경에서 LLM 기반 에이전트의 성능을 향상시키는 도전 과제를 해결합니다. 표준 RL 베이스라인들이 종종 어려움을 겪는 탐색, 쇼핑, 검색과 같은 다양한 작업에서 에이전트의 능력을 향상시키는 프레임워크를 제공합니다.

작동 방식

SDAR는 게이팅 메커니즘을 활용하는 자기증류형 에이전트 강화학습 방법을 구현합니다. 이는 에이전트가 자신의 성공적인 트래잭터리에서 학습하고, 자기증류 과정을 통해 기술을 진화할 수 있도록 합니다. 프레임워크는 GRPO, RLSD, Skill-SD와 같은 다양한 RL 방법을 지원하며, Qwen3 및 Qwen2.5와 같은 모델과 호환됩니다.

대상 사용자

이 프로젝트는 특히 자기증류 기법을 구현하거나 실험하여 인터랙티브 환경에서 LLM 에이전트의 성능을 향상시키고자 하는 AI 연구자 및 개발자를 위한 것입니다.

주요 특징

  • 통합 프레임워크: Agentic RL과 OP(S)D를 통합한 최초의 오픈소스 프레임워크입니다.
  • 광범위한 환경 지원: ALFWorld, WebShop, Search-QA와 호환됩니다.
  • 다양한 방법 지원: OPSD, GRPO 및 특허된 SDAR 방법을 포함한 다양한 학습 방법을 지원합니다.
  • 풍부한 연구 생태계: TASPO, AHEAD, AgentOPSD와 같은 수많은 후속 연구의 기반이 되고 있습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트