alibaba/skill-up
An evaluation and evolution tool for Agent Skills.
What it solves
skill-up은 "Agent Skills"(AI 에이전트에게 부여된 능력)를 측정, 평가 및 개선할 수 있는 구조화된 방법을 제공합니다. 이는 임시적인 테스트를 반복 가능하고 선언적인 평가 루프로 대체하여, 성능 저하를 방지하고 다양한 에이전트 엔진에 걸쳐 기술 향상을 측정할 수 있도록 보장합니다.
How it works
이 도구는 평가 환경, 엔진 및 테스트 케이스를 YAML 파일로 정의하는 선언적 구성 시스템을 사용합니다. 세 가지 주요 판정 전략을 지원합니다: rule-based, script-based, agent-based 판정 방식입니다.
개선 루프를 완성하기 위해, Claude Code 또는 Codex와 같은 에이전트에 설치할 수 있는 AI 에이전트 기술인 skill-upper를 포함합니다. skill-upper는 실패 보고서를 읽고, 기술이나 평가 케이스가 잘못되었는지 진단하며, 코드나 테스트를 수정하고, 자연스러운 대화를 통해 회귀 테스트 케이스를 자동으로 추가할 수 있습니다.
Who it’s for
이 도구는 여러 에이전트 엔진(Qoder CLI, Claude Code, Codex 등)에 걸쳐 성능을 검증해야 하고 이러한 테스트를 CI/CD 파이프라인에 통합해야 하는 AI 에이전트 기술 개발자를 위해 설계되었습니다.
Highlights
- Eval-to-Evolution Loop: 실패 보고서를 기반으로 AI 에이전트(skill-upper)를 사용하여 평가 스위트를 자동으로 수정하고 확장합니다.
- Multi-Engine Support: Claude Code, Codex, Codex 및 Qoder CLI를 포함한 다양한 에이전트 엔진과 호환됩니다.
- Declarative Config: YAML을 사용하여 케이스와 환경을 정의하므로 테스트가 반복 가능하고 버전 관리가 가능합니다.
- CI-Ready: 모든 pull request에 대해 평가를 실행하는 전용 GitHub Action을 포함합니다.
- Anthropic Compatibility: 기존의
evals.json파일을 YAML 형식으로 가져올 수 있습니다.
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트