darkrishabh/agent-skills-eval
A test runner for agentskills.io-style AI agent skills
해결하는 문제
SKILL.md 파일을 통해 제공되는 '스킬'(도메인 지식)이 특정 작업에서 AI 에이전트의 성능을 실제로 향상시키는지 여부를 실험적으로 입증할 수 있는 방법을 제공합니다. 모델에 스킬을 로드한 경우와 로드하지 않은 경우를 병렬로 비교함으로써 '직관 기반' 평가를 제거합니다.
작동 방식
스킬 구성에 정의된 각 평가에 대해, 이 도구는 동일한 프롬프트를 두 번 실행합니다: 하나는 SKILL.md 내용을 컨텍스트에 포함한 경우(with_skill), 다른 하나는 포함하지 않은 경우(without_skill). 별도의 판정 모델이 두 출력을 동일한 주장과 예상 출력 기준으로 평가하여 각 측면에 대해 통과/실패 결과를 생성합니다. 시스템은 OpenAI 호환 API, 사용자 정의 제공자 지원 및 결과를 포터블한 JSON/JSONL 아티팩트 또는 정적 HTML 리포트로 출력할 수 있습니다.
대상 사용자
agentskills.io 사양을 따르며 모델에 제공하는 도메인 지식을 엄격하고 자동화된 방식으로 테스트하고 반복 개선이 필요한 AI 에이전트 개발자.
주요 특징
- 스킬용 A/B 테스트: 베이스라인과 스킬 활성화 프롬프트를 직접 비교하여 성능 향상을 측정.
- 판정 기반 평가: 단순한 문자열 매칭이 아닌 인용된 주장 제공을 위한 챗 모델 사용.
- 사양 준수:
SKILL.md및evals.json에 대해 agentskills.io 사양을 완전히 구현. - 도구 호출 주장: 도구 호출을 사용하는 에이전트를 위한 결정론적 검사 지원.
- 유연한 통합: CI/CD 파이프라인용 CLI와 사용자 정의 대시보드용 TypeScript SDK 모두 제공.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트