ZJU-REAL/SkillZero

[EMNLP 2026] Official code for "SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization"

何を解決するか

SKILL0 は AI エージェントにおけるスキルの内面化の課題に対処するためのフレームワークです。エージェントが環境や相互作用からスキルを学び、内面化する方法を改善し、ALFWorld や Search-QA などの複雑なタスクでより優れたパフォーマンスを発揮できるようにします。

仕組み

SKILL0 は文脈内強化学習(RL)フレームワークです。エージェントRLを用いて、モデルがスキルを内面化できるようにし、外部のガイドラインやプロンプトに依存するのではなく、ポリシー自体にその能力を内包するようにします。

対象ユーザー

強化学習、エージェント型AI、およびLLMベースのエージェントが経験を通じて複雑なスキルを習得・内面化する能力に関する研究や開発に従事する研究者や開発者。

主な特徴

  • 文脈内RL: 文脈内学習を活用し、スキルの内面化を促進します。
  • パフォーマンス向上: ALFWorld および Search-QA ベンチマークにおいて、標準的なRLベースラインと比較して顕著な改善を示します。
  • 環境サポート: ALFWorld や Search-QA などの複雑な環境をネイティブでサポートしています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • Dispatch