ZJU-REAL/SkillZero

[EMNLP 2026] Official code for "SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization"

解决的问题

SKILL0 旨在解决 AI 代理在技能内化方面的挑战。它致力于改进代理从环境和交互中学习并内化技能的方式,使其在 ALFWorld 和 Search-QA 等复杂任务中表现更佳。

工作原理

SKILL0 是一种上下文内强化学习(RL)框架。它利用代理强化学习,使模型能够内化技能,从依赖外部指导或提示转变为将这些能力内置于策略本身。

适用人群

从事强化学习、代理型 AI 以及基于大语言模型的代理通过经验获取和内化复杂技能的研究人员和开发者。

主要亮点

  • 上下文内 RL:利用上下文学习促进技能的内化。
  • 性能提升:在 ALFWorld 和 Search-QA 基准测试中,显著优于标准 RL 基线。
  • 环境支持:内置对 ALFWorld 和 Search-QA 等复杂环境的支持。

相关

  • 项目
  • Dispatch
  • 项目
  • Dispatch