microsoft/waza
CLI / Framework for Agent Skills - create, test, measure and improve skill quality and effectiveness
解決的問題
Waza 是一款專為評估 AI 代理技能而設計的命令列工具。它提供了一種結構化的方式,用於建構評估套件、在不同模型上執行基準測試,並比較結果,以判斷在特定任務中表現最佳的模型或代理設定。
作業原理
Waza 使用技能定義(SKILL.md)與評估規格(eval.yaml)的系統。使用者可建立技能,並自動產生對應的評估任務與測試範本。該工具可使用各種模型(包括與 GitHub Copilot 的整合)執行這些任務,利用本地或遠端評分器評估輸出,並提供通過率與效能差異的詳細報告。
適用對象
需要嚴謹且可重現方式來進行 AI 代理能力基準測試、測試回歸問題,並驗證代理是否遵守預期範圍與安全邊界的 AI 開發者與研究人員。
主要特色
- 全面的基準測試:在多個模型上執行評估,並並排比較結果。
- 自動化腳手架:快速初始化專案、建立新技能,並從提示產生評估任務。
- 進階測試:內建對抗性測試套件,用以探測提示注入與範圍繞過。
- 決定性檢查:擷取執行快照,以重播與二分排查異常輸出,便於除錯。
- CI/CD 整合:內建支援 GitHub Actions 與 JUnit 報告,可在流程中自動化代理評估。
- 結果快取:除非設定或測試範本變更,否則快取結果以加速重複執行。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch