ZJU-REAL/SkillZero

[EMNLP 2026] Official code for "SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization"

解決的問題

SKILL0 是為了解決 AI 代理在技能內化方面的挑戰而設計的。其目標在於改善代理從環境與互動中學習並內化技能的方式,使其在 ALFWorld 和 Search-QA 等複雜任務中表現更佳。

工作原理

SKILL0 是一種上下文內強化學習(RL)框架。它利用代理式強化學習,使模型能夠內化技能,從依賴外部引導或提示,轉變為將這些能力內建於策略本身。

適用對象

從事強化學習、代理型 AI,以及基於大語言模型的代理如何透過經驗獲取與內化複雜技能的研究人員與開發者。

主要亮點

  • 上下文內 RL:利用上下文學習促進技能的內化。
  • 性能提升:在 ALFWorld 和 Search-QA 基準測試中,顯著優於標準 RL 基線。
  • 環境支援:內建支援 ALFWorld 和 Search-QA 等複雜環境。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch