microsoft/waza
CLI / Framework for Agent Skills - create, test, measure and improve skill quality and effectiveness
何を解決するか
Waza は AI エージェントのスキルを評価するためのコマンドラインツールです。評価スイートの構築、さまざまなモデルでのベンチマーク実行、結果の比較を通じて、特定のタスクにおいて最も優れたモデルやエージェント構成を特定する構造化された方法を提供します。
動作方法
Waza はスキル定義(SKILL.md)と評価仕様(eval.yaml)のシステムを使用します。ユーザーはスキルを作成し、それに応じた評価タスクとフィクスチャを生成できます。このツールは、GitHub Copilot との統合を含むさまざまなモデルでタスクを実行し、ローカルまたはリモートのグレーダーで出力を評価し、合格率やパフォーマンスの差異に関する詳細レポートを提供します。
対象ユーザー
AIエージェントの能力を厳密かつ再現可能にベンチマークする必要があるAI開発者や研究者。リグレッションのテストや、エージェントが意図された範囲やセーフティ境界に従っているかを検証するためのツールとして最適です。
主な特徴
- 包括的なベンチマーク: 複数のモデルで評価を実行し、結果を横並びで比較可能。
- 自動スケルトン生成: プロジェクトの初期化、新しいスキルの作成、プロンプトから評価タスクの生成を迅速に実行。
- 高度なテスト: プロンプトインジェクションや範囲バイパスを検出するための敵対的テストパックを含む。
- 決定論的チェック: 実行時のスナップショットを取得し、出力の差異を再現・二分探索してデバッグ可能。
- CI/CD統合: GitHub Actions と JUnit レポートに対応した組み込みサポートにより、パイプライン内でエージェント評価を自動化可能。
- 結果キャッシュ: 設定やフィクスチャが変更されない限り、結果をキャッシュして繰り返し実行を高速化。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch