microsoft/waza

CLI / Framework for Agent Skills - create, test, measure and improve skill quality and effectiveness

해결하는 문제

Waza는 AI 에이전트의 역량을 평가하기 위한 명령줄 도구입니다. 평가 세트를 체계적으로 구축하고, 다양한 모델에서 벤치마크를 실행하며, 결과를 비교하여 특정 작업에서 가장 우수한 모델 또는 에이전트 구성이 무엇인지 파악할 수 있는 구조화된 방법을 제공합니다.

작동 방식

Waza는 스킬 정의(SKILL.md)와 평가 사양(eval.yaml)의 시스템을 사용합니다. 사용자는 스킬을 생성한 후 해당 스킬에 맞는 평가 작업과 테스트 피처를 자동 생성할 수 있습니다. 이 도구는 GitHub Copilot과의 통합을 포함한 다양한 모델로 작업을 실행하고, 로컬 또는 원격 그레이더를 사용해 출력을 평가하며, 통과율과 성능 차이에 대한 상세 보고서를 제공합니다.

대상 사용자

AI 에이전트의 능력을 엄격하고 재현 가능한 방식으로 벤치마크하고, 회귀 테스트를 수행하며, 에이전트가 의도된 범위와 안전 경계를 지키고 있는지 검증해야 하는 AI 개발자 및 연구자에게 적합합니다.

주요 기능

  • 포괄적인 벤치마크: 여러 모델에서 평가를 실행하고 결과를 옆으로 비교 가능.
  • 자동 스켈레톤 생성: 프로젝트 초기화, 새로운 스킬 생성, 프롬프트에서 평가 작업 자동 생성이 빠르게 가능.
  • 고급 테스트: 프롬프트 인젝션 및 범위 우회를 탐지하기 위한 적대적 테스트 팩 포함.
  • 결정론적 검사: 실행 스냅샷을 캡처하여 출력의 차이를 재현하고 디버깅에 활용 가능.
  • CI/CD 통합: GitHub Actions 및 JUnit 보고서를 위한 내장 지원으로 파이프라인에서 에이전트 평가를 자동화 가능.
  • 결과 캐싱: 설정이나 피처가 변경되지 않는 한 결과를 캐시하여 반복 실행을 빠르게 처리.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch