tripleyak/SkillForge
A skill creator that proves its skills work. Evidence-driven skill creation for Claude Code and Codex: baseline-tested generation, per-skill regression evals, ecosystem doctor, cross-runtime compile, and an opt-in proactive advisor.
解決的問題
SkillForge 解決了創建低品質或重複的 AI「技能」(指令/提示)的問題,這些技能實際上並未提升代理效能。它摒棄了基於文件的審核方式,轉而採用行為驅動的方法,確保只有在與無該技能的基線相比能明顯提升代理完成任務能力時,才會建立新技能。
工作原理
SkillForge 使用基於證據的流水線來管理 AI 技能的生命周期:
- 篩選與紅門測試:檢查技能是否已存在,並執行「紅門測試」——一個全新代理在無該技能的情況下嘗試完成任務;若代理成功,則不建立新技能。
- 分析與規格制定:使用特定視角(如帕累托或根本原因)分析失敗情況,並制定分層規格。
- 生成與綠門測試:子代理根據規格生成技能,並透過「綠門測試」驗證代理現在能成功完成此前失敗的基線任務。
- 審查與發布:技能經由對抗性代理進行 lint 檢查與審查後,連同其獨立的回歸測試套件(evals)一起發布。
適用對象
專為使用 AI 代理(特別是 Claude Code 和 Codex CLI)的使用者設計,幫助他們建構、維護與優化可重複使用的技能庫。
核心亮點
- 行為驗證:使用紅/綠門測試證明技能確實提升效能。
- 回歸測試:每個技能都附帶
evals/檔案夾與執行器,確保其持續有效。 - 生態系統健康:包含「醫生」工具,可跨所有技能發現觸發器衝突、重複項與過期引用。
- 跨執行時支援:作者只需撰寫一次技能,即可編譯為適用於 Claude、Codex 或 AgentSkills 等不同目標的版本。
- 摩擦挖掘:可選工具,分析本地會話歷史,識別需要新技能的空白點。
相關
- 專案
- 專案
- 專案
- 專案
- 專案