microsoft/waza

CLI / Framework for Agent Skills - create, test, measure and improve skill quality and effectiveness

解决的问题

Waza 是一个用于评估 AI 代理技能的命令行工具。它提供了一种结构化的方法,用于搭建评估套件、在不同模型上运行基准测试,并比较结果,以确定在特定任务中表现最佳的模型或代理配置。

工作原理

Waza 使用技能定义(SKILL.md)和评估规范(eval.yaml)的系统。用户可以创建技能,然后生成相应的评估任务和测试用例。该工具可以使用各种模型(包括与 GitHub Copilot 的集成)执行这些任务,使用本地或远程评分器对输出进行评分,并提供关于通过率和性能差异的详细报告。

适用人群

需要一种严格且可复现的方式来对 AI 代理能力进行基准测试、测试回归问题,并验证代理是否遵守其预期范围和安全边界的 AI 开发者和研究人员。

主要亮点

  • 全面的基准测试:在多个模型上运行评估,并并排比较结果。
  • 自动化脚手架:快速初始化项目、创建新技能,并从提示生成评估任务。
  • 高级测试:包含对抗性测试包,用于探测提示注入和范围绕过。
  • 确定性检查:捕获运行快照以重放和二分排查异常输出,便于调试。
  • CI/CD 集成:内置对 GitHub Actions 和 JUnit 报告的支持,可在流水线中自动化代理评估。
  • 结果缓存:除非配置或测试用例发生变化,否则缓存结果以加快重复运行速度。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch