tripleyak/SkillForge
A skill creator that proves its skills work. Evidence-driven skill creation for Claude Code and Codex: baseline-tested generation, per-skill regression evals, ecosystem doctor, cross-runtime compile, and an opt-in proactive advisor.
解决的问题
SkillForge 解决了创建低质量或重复的 AI「技能」(指令/提示)的问题,这些技能实际上并未提升代理性能。它摒弃了基于文档的审批方式,转而采用行为驱动的方法,确保只有在与无该技能的基线相比能显著提升代理完成任务能力时,才会创建新技能。
工作原理
SkillForge 使用基于证据的流水线来管理 AI 技能的生命周期:
- 筛选与红门测试:检查技能是否已存在,并运行「红门测试」——一个全新代理在无该技能的情况下尝试完成任务;如果代理成功,则不创建新技能。
- 分析与规格制定:使用特定视角(如帕累托或根本原因)分析失败情况,并制定分层规格。
- 生成与绿门测试:子代理根据规格生成技能,并通过「绿门测试」验证代理现在能成功完成此前失败的基线任务。
- 审查与发布:技能经过对抗性代理的 lint 检查和审查后,连同其独立的回归测试套件(evals)一起发布。
适用人群
专为使用 AI 代理(特别是 Claude Code 和 Codex CLI)的用户设计,帮助他们构建、维护和优化可复用的技能库。
核心亮点
- 行为验证:使用红/绿门测试证明技能确实提升了性能。
- 回归测试:每个技能都自带
evals/文件夹和运行器,确保其持续有效。 - 生态系统健康:包含「医生」工具,可跨所有技能发现触发器冲突、重复项和过期引用。
- 跨运行时支持:作者只需编写一次技能,即可编译为适用于 Claude、Codex 或 AgentSkills 等不同目标的版本。
- 摩擦挖掘:可选工具,分析本地会话历史,识别需要新技能的空白点。
相关
- 项目
- 项目
- 项目
- 项目
- 项目