SkillOpt: 一种用于自我进化的代理技能的执行策略,通过深度学习优化原则优化技能文档

SkillOpt: 一种用于自我进化的代理技能的执行策略,通过深度学习优化原则优化技能文档

它解决的问题

SkillOpt 解决了缺乏系统且可重复的方法来提升代理技能的问题。目前大多数代理技能是手工制作或一次性生成的,这通常无法基于反馈可靠地随时间改进。SkillOpt 将技能文档本身视为可训练的状态,使代理能够在不修改底层模型权重的情况下进化其能力。

它是如何工作的

SkillOpt 将深度学习优化原则应用于文本技能文档。它使用一个独立的优化器模型来分析得分的 rollouts,并对技能文档执行有界编辑(添加、删除或替换文本)。为了确保稳定性和进展,它采用了验证门,只有当候选编辑能够严格提升留出验证分数时才接受。该过程包括文本学习率预算、被拒绝编辑缓冲区以及 epoch-wise 更新。最终输出是一个紧凑的 best_skill.md 文件,在使用冻结目标模型进行推理时使用,部署时不会增加额外的延迟或模型调用。

它适用于谁

它专为 AI 代理开发者设计(例如使用 Claude Code、Codex 或 Copilot 的开发者),他们希望在不进行昂贵的模型微调的情况下,系统地优化其代理在特定基准或任务上的性能。

亮点

  • 无权重优化:通过优化技能文档而非模型权重来提升代理性能。
  • 严格的训练循环:实现 rollout、反思、聚合、选择、更新和评估的完整循环。
  • SkillOpt-Sleep:一个夜间离线引擎,通过收集、挖掘和重放过去的会话来巩固已验证的技能。
  • 广泛兼容性:支持多种后端(OpenAI、Azure、Claude、Qwen、MiniMax),并可与各种执行工具集成。
  • 零推理开销:优化后的技能是一个静态文本文件,这意味着在部署期间不需要额外的计算。

Sources