darkrishabh/agent-skills-eval
A test runner for agentskills.io-style AI agent skills
何を解決するか
スキル(SKILL.md ファイル経由で提供されるドメイン知識)がAIエージェントの特定タスクにおけるパフォーマンスを実際に向上させるかどうかを、実証的に証明する方法を提供します。モデルにスキルをロードした場合とロードしない場合を並行して比較することで、「感覚に基づく」評価を排除します。
動作方法
スキルの設定で定義された各評価について、このツールは同じプロンプトを2回実行します:1回目は SKILL.md の内容をコンテキストに含める(with_skill)、もう1回は含めない(without_skill)。別途、ジャッジモデルが両方の出力を同じアサーションと期待される出力に対して評価し、それぞれの側について成功/失敗の結果を出力します。このシステムはOpenAI互換API、カスタムプロバイダーをサポートしており、ポータブルなJSON/JSONLアーティファクトや静的HTMLレポートとして結果を出力できます。
対象ユーザー
agentskills.io仕様に従ってAIエージェントを開発し、モデルに提供するドメイン知識を厳密かつ自動的にテスト・反復できる手段が必要な開発者。
主な特徴
- スキル用A/Bテスト:ベースラインとスキル有効化プロンプトを直接比較し、パフォーマンス向上を測定。
- ジャッジベースの評価:単純な文字列マッチではなく、引用付きのアサーションを提供するチャットモデルを使用。
- 仕様準拠:
SKILL.mdおよびevals.jsonについて、agentskills.io仕様を完全に実装。 - ツールコールアサーション:ツールコールを利用するエージェント向けの決定論的チェックをサポート。
- 柔軟な統合:CI/CDパイプライン向けCLIと、カスタムダッシュボード向けTypeScript SDKの両方を提供。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト