microsoft/SkillOpt
SkillOpt is a text-space optimizer that trains reusable natural-language skills for frozen LLM agents through trajectory-driven edits, validation-gated updates, and deployable best_skill.md artifacts.
解决的问题
SkillOpt 解决了智能体技能不一致且依赖手工制作的问题。大多数 AI 智能体的技能要么是手动编写的,要么是由 LLM 一次性生成的,这往往无法根据反馈在时间推移中实现可靠的改进。SkillOpt 提供了一种系统化、可复现的方法来优化这些技能,而无需修改底层模型的权重。
工作原理
SkillOpt 将技能文档(一个 Markdown 文件)视为冻结 LLM 的“可训练状态”。它使用一个独立的优化器模型,通过训练循环(rollout、reflection、aggregation、selection 和 update)来迭代改进该文档。
核心机制包括:
- Validation Gates:只有当候选编辑能严格提高预留验证分数时,才会接受对技能文档的编辑。
- Optimization Parameters:将 epoch、batch size 和 learning rate 等深度学习概念应用于文本编辑。
- SkillOpt-Sleep:一个离线引擎,在“睡眠”期间收集过去的会话、重放任务并整合经过验证的技能。
- Zero Overhead:由于最终输出只是一个紧凑的 Markdown 文件 (
best_skill.md),因此在实际部署期间不需要额外的模型调用。
适用对象
专为构建 AI 智能体(例如使用 Claude Code、Codex 或 Copilot 的开发者)而设计,这些开发者希望在不同的基准测试和测试框架中自动升级其智能体的能力和性能。
亮点
- Model Agnostic:支持包括 OpenAI、Azure、Claude、Qwen 和 MiniMax 在内的各种后端。
- High Performance:在多个基准测试中证明了在 GPT-5.5 上具有显著的准确度提升(高达 +24.8 分)。
- Transferable:优化后的技能可以在不同的模型规模和执行框架之间迁移。
- Offline Evolution:包含用于本地编码智能体的夜间自我进化引擎。
相关
- 项目
- 项目
- 项目
- 项目
- 项目