microsoft/waza

CLI / Framework for Agent Skills - create, test, measure and improve skill quality and effectiveness

解決的問題

Waza 是一款專為評估 AI 代理技能而設計的命令列工具。它提供了一種結構化的方式,用於建構評估套件、在不同模型上執行基準測試,並比較結果,以判斷在特定任務中表現最佳的模型或代理設定。

作業原理

Waza 使用技能定義(SKILL.md)與評估規格(eval.yaml)的系統。使用者可建立技能,並自動產生對應的評估任務與測試範本。該工具可使用各種模型(包括與 GitHub Copilot 的整合)執行這些任務,利用本地或遠端評分器評估輸出,並提供通過率與效能差異的詳細報告。

適用對象

需要嚴謹且可重現方式來進行 AI 代理能力基準測試、測試回歸問題,並驗證代理是否遵守預期範圍與安全邊界的 AI 開發者與研究人員。

主要特色

  • 全面的基準測試:在多個模型上執行評估,並並排比較結果。
  • 自動化腳手架:快速初始化專案、建立新技能,並從提示產生評估任務。
  • 進階測試:內建對抗性測試套件,用以探測提示注入與範圍繞過。
  • 決定性檢查:擷取執行快照,以重播與二分排查異常輸出,便於除錯。
  • CI/CD 整合:內建支援 GitHub Actions 與 JUnit 報告,可在流程中自動化代理評估。
  • 結果快取:除非設定或測試範本變更,否則快取結果以加速重複執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch