tripleyak/SkillForge
A skill creator that proves its skills work. Evidence-driven skill creation for Claude Code and Codex: baseline-tested generation, per-skill regression evals, ecosystem doctor, cross-runtime compile, and an opt-in proactive advisor.
해결하는 문제
SkillForge는 실제로 에이전트 성능을 향상시키지 못하는 저품질 또는 중복되는 AI '스킬'(지시/프롬프트)을 생성하는 문제를 해결합니다. 문서 기반 승인에서 벗어나 행동 기반 접근법을 채택하여, 특정 스킬이 기준선(해당 스킬 없이)과 비교해 태스크 수행 능력을 실제로 향상시키는 경우에만 스킬이 생성되도록 보장합니다.
작동 방식
SkillForge는 AI 스킬의 라이프사이클을 관리하는 증거 기반 파이프라인을 사용합니다:
- 선별 및 레드 게이트: 스킬이 이미 존재하는지 확인하고, '레드 게이트' 테스트를 수행합니다. 새로 생성된 에이전트가 해당 스킬 없이 태스크를 성공하면 새로운 스킬은 생성되지 않습니다.
- 분석 및 사양: 특정 렌즈(예: 파레토, 근본 원인)를 사용해 실패를 분석하고 계층적인 사양을 생성합니다.
- 생성 및 그린 게이트: 서브에이전트가 사양에 따라 스킬을 생성하고, '그린 게이트' 테스트를 통해 이전에 실패했던 기준선이 이제 성공하는지 확인합니다.
- 검토 및 배포: 악성 에이전트에 의해 린트 및 검토된 후, 자체 리그레션 테스트 세트(evals)와 함께 배포됩니다.
대상 사용자
특히 Claude Code 및 Codex CLI 사용자로서, 재사용 가능한 스킬 라이브러리를 구축하고 유지보수하며 최적화하고자 하는 사용자에게 적합합니다.
주요 특징
- 행동 검증: 레드/그린 게이트를 사용해 스킬이 실제로 성능을 향상시키는지 입증합니다.
- 리그레션 테스트: 모든 스킬은 자체
evals/폴더와 실행기와 함께 제공되어 지속적인 작동을 보장합니다. - 에코시스템 건강성: 모든 스킬 간의 트리거 충돌, 중복, 오래된 참조를 탐지하는 '의사' 도구를 포함합니다.
- 크로스 런타임 지원: 한 번 작성한 스킬을 Claude, Codex, AgentSkills 등 다양한 타겟으로 컴파일할 수 있습니다.
- 마찰 탐지: 로컬 세션 기록을 분석해 새로운 스킬이 필요한 갭을 식별하는 옵트인 도구입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트