alchaincyf/darwin-skill

达尔文.skill —— 一个让你的Skill无限进化的系统:评估→改进→测试→保留或回滚 | Autoresearch-inspired autonomous skill optimization for Claude Code. Evaluate, improve, test, keep or revert.

해결하는 문제

SKILL.md 형식으로 정의된 많은 수의 에이전트 스킬을 수동으로 관리하는 것은 라이브러리가 커질수록 실용적이지 않게 된다. 기존 리뷰는 구조적 정확성(포맷 및 경로)에 초점을 맞추지만, 실제로 원하는 결과를 내는지 여부는 종종 간과된다. Darwin-skill은 이러한 스킬들을 측정 가능한 반복 루프를 통해 진화하는 '훈련 가능한 자산'으로 간주함으로써 체계적인 최적화 방법을 제공한다.

작동 방식

Andrej Karpathy의 autoresearch에 영감을 받아, 이 프로젝트는 '라쳇 메커니즘'을 구현한다. 스킬은 반복적으로 개선되며, 측정 가능한 점수 향상만을 가져오는 변경 사항만 유지되고, 나머지는 git를 통해 자동으로 롤백된다.

최적화 과정은 다음과 같은 단계를 따른다:

  1. 기준 평가: 현재 스킬이 9차원 평가 척도에 따라 평가된다.
  2. 대상 최적화: 시스템은 가장 약한 차원(가중치 차이)을 식별하고, 해당 단일 차원에 대한 구체적인 개선안을 생성한다.
  3. 독립 검증: 두 개의 독립된 하위 에이전트가 새로운 버전을 평가하여 자기 평가 편향을 방지한다. 각 라운드마다 새로운 심사위원을 사용하여 앵커링 효과를 방지한다.
  4. 라쳇 적용: 점수가 향상되면 변경 사항이 커밋되고, 그렇지 않으면 되돌려진다.
  5. 사람이 참여하는 루프: 기준, 단일 차원 최적화, 회귀 테스트와 같은 중요한 체크포인트에서 프로세스가 일시 정지되어 사용자의 확인을 기다린다.

대상 사용자

Claude Code, Codex, OpenClaw, Trae, CodeBuddy 등의 도구용 스킬 라이브러리를 유지 관리하고, 이러한 스킬의 품질과 신뢰성을 프로그래밍적으로 향상시키고자 하는 개발자 및 AI 에이전트 사용자.

주요 특징

  • 9차원 평가: Microsoft Research의 SkillLens 기반 평가 척도로, 실패 모드 인코딩, 실행 가능한 구체성, 고위험 행동 블랙리스트를 포함한다.
  • 검증 게이트 편집: 모든 편집이 병합되기 전에 검증되도록 SkillOpt 프레임워크와 일치한다.
  • 악성 패턴 방지: 동일한 AI가 스킬을 편집하고 평가하는 것을 명시적으로 금지한다.
  • Git 기반 버전 관리: git를 사용하여 스킬의 품질이 항상 향상되며, 로컬에서의 품질 저하가 발생하지 않도록 보장한다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트