alchaincyf/darwin-skill

达尔文.skill —— 一个让你的Skill无限进化的系统:评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.

解决的问题

随着技能库的增长,手动管理大量以 SKILL.md 格式定义的 Agent Skills 变得不切实际。传统评审通常只关注结构正确性(格式和路径),却常常忽略技能是否真正产生预期结果。Darwin-skill 提供了一种系统化的方法,将这些技能视为可训练的资产,通过可测量的迭代循环实现持续优化。

工作原理

受 Andrej Karpathy 的 autoresearch 启发,该项目实现了一种「棘轮机制」:技能被迭代改进,只有带来可测量分数提升的变更才会被保留,其他变更则通过 git 自动回滚。

优化过程遵循以下步骤:

  1. 基线评估:当前技能根据 9 维度评分标准进行评估。
  2. 针对性优化:系统识别出最弱的维度(加权差距),并为该单一维度生成具体的改进建议。
  3. 独立验证:两个独立的子代理对新版本进行评估,以避免自我评估偏差。每轮使用新的裁判,防止锚定效应。
  4. 棘轮应用:若分数提升,则提交变更;否则自动回滚。
  5. 人机协同:在关键检查点(基线、单维度优化、回归测试)暂停流程,等待用户确认。

适用人群

维护 Claude Code、Codex、OpenClaw、Trae 或 CodeBuddy 等工具技能库的开发者和 AI 代理用户,希望以程序化方式提升这些技能的质量与可靠性。

核心亮点

  • 9 维度评估:基于 Microsoft Research 的 SkillLens 评分体系,包含失败模式编码、可操作具体性、高风险操作黑名单等维度。
  • 验证门控编辑:遵循 SkillOpt 框架,确保每次编辑在合并前都经过验证。
  • 反模式预防:明确禁止常见陷阱,例如由同一 AI 同时负责编辑和评估技能。
  • 基于 Git 的版本控制:利用 git 保证技能质量只增不减,杜绝本地退化。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目