ZJU-REAL/SkillZero

[EMNLP 2026] Official code for "SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization"

해결하는 문제

SKILL0는 AI 에이전트의 기술 내면화 문제를 해결하기 위해 설계되었습니다. 환경과 상호작용을 통해 기술을 학습하고 내면화하는 방식을 개선하여 ALFWorld 및 Search-QA와 같은 복잡한 작업에서 더 나은 성능을 발휘할 수 있도록 합니다.

작동 방식

SKILL0는 문맥 기반 강화학습(RL) 프레임워크입니다. 에이전트 기반 RL을 사용하여 모델이 기술을 내면화할 수 있도록 하며, 외부 안내나 프롬프트에 의존하는 대신 정책 자체에 이러한 능력을 내재화하도록 합니다.

대상 사용자

강화학습, 에이전트형 AI, 그리고 LLM 기반 에이전트가 경험을 통해 복잡한 기술을 습득하고 내면화할 수 있는 능력에 관심 있는 연구자 및 개발자.

주요 특징

  • 문맥 기반 RL: 문맥 기반 학습을 활용하여 기술의 내면화를 촉진합니다.
  • 성능 향상: ALFWorld 및 Search-QA 벤치마크에서 표준 RL 기준 대비 상당한 성능 향상을 보입니다.
  • 환경 지원: ALFWorld 및 Search-QA와 같은 복잡한 환경을 내장된 지원 기능으로 제공합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • Dispatch