alchaincyf/darwin-skill

达尔文.skill —— 一个让你的Skill无限进化的系统:评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.

何を解決するか

SKILL.md 形式で定義された多数の Agent Skills を手動で管理すると、ライブラリが拡大するにつれて実用的でなくなる。従来のレビューは構造的正しさ(フォーマットやパス)に焦点を当てるが、実際に望ましい結果を生み出すかどうかは無視されがちである。Darwin-skill は、これらのスキルを「訓練可能な資産」として扱い、測定可能な反復ループを通じて進化させる、体系的な最適化手法を提供する。

動作方法

Andrej Karpathy の autoresearch にインスパイアされ、このプロジェクトは「ラチェット機構」を実装している。スキルは反復的に改善され、測定可能なスコアの向上をもたらす変更のみが保持され、それ以外は git を使って自動的にロールバックされる。

最適化プロセスは以下のステップに従う:

  1. ベースライン評価:現在のスキルが 9 次元の評価基準に基づいて評価される。
  2. ターゲット最適化:システムは最も弱い次元(重み付きギャップ)を特定し、その単一の次元に対して具体的な改善を生成する。
  3. 独立した検証:2 つの独立したサブエージェントが新しいバージョンを評価し、自己評価バイアスを回避する。各ラウンドで新しいジャッジが使用され、アンカリング効果を防ぐ。
  4. ラチェット適用:スコアが向上した場合、変更はコミットされる。そうでなければ、元に戻される。
  5. 人間の参加:ベースライン、単一次元最適化、回帰テストの重要なチェックポイントでプロセスが一時停止し、ユーザーの確認を待つ。

対象ユーザー

Claude Code、Codex、OpenClaw、Trae、CodeBuddy などのツール用のスキルライブラリを維持し、それらのスキルの品質と信頼性をプログラム的に向上させたい開発者や AI エージェントユーザー。

特徴

  • 9 次元評価:Microsoft Research の SkillLens を基にした評価基準。失敗モードのエンコード、実行可能な具体的さ、高リスク行動のブラックリストを含む。
  • 検証ゲート付き編集:SkillOpt フレームワークに準拠し、すべての編集がマージ前に検証されることを保証する。
  • アンチパターン防止:AI が同一のスキルの編集と評価を行うことを明示的に禁止する。
  • Git ベースのバージョン管理:git を使って、スキルの品質が常に向上し、ローカルでの劣化が発生しないように保証する。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト