alchaincyf/darwin-skill
达尔文.skill —— 一个让你的Skill无限进化的系统:评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.
解決的問題
隨著技能庫的擴大,手動管理大量以 SKILL.md 格式定義的 Agent Skills 變得不切實際。傳統審查通常只關注結構正確性(格式與路徑),卻常常忽略技能是否真正產生預期結果。Darwin-skill 提供了一種系統化的方法,將這些技能視為可訓練的資產,透過可測量的迭代循環實現持續優化。
工作原理
受 Andrej Karpathy 的 autoresearch 啟發,本專案實作了一種「棘輪機制」:技能被迭代改進,只有帶來可測量分數提升的變更才會被保留,其他變更則透過 git 自動回滾。
優化過程遵循以下步驟:
- 基線評估:當前技能根據 9 維度評分標準進行評估。
- 針對性優化:系統識別出最弱的維度(加權差距),並為該單一維度生成具體的改進建議。
- 獨立驗證:兩個獨立的子代理對新版本進行評估,以避免自我評估偏見。每輪使用新的裁判,防止錨定效應。
- 棘輪應用:若分數提升,則提交變更;否則自動回滾。
- 人機協同:在關鍵檢查點(基線、單維度優化、回歸測試)暫停流程,等待使用者確認。
適用對象
維護 Claude Code、Codex、OpenClaw、Trae 或 CodeBuddy 等工具技能庫的開發者與 AI 代理使用者,希望以程式化方式提升這些技能的品質與可靠性。
核心亮點
- 9 維度評估:基於 Microsoft Research 的 SkillLens 評分體系,包含失敗模式編碼、可操作具體性、高風險操作黑名單等維度。
- 驗證門控編輯:遵循 SkillOpt 框架,確保每次編輯在合併前都經過驗證。
- 反模式預防:明確禁止常見陷阱,例如由同一 AI 同時負責編輯與評估技能。
- 基於 Git 的版本控制:利用 git 保證技能品質只增不減,杜絕本地退化。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案