darkrishabh/agent-skills-eval

A test runner for agentskills.io-style AI agent skills

何を解決するか

スキル(SKILL.md ファイル経由で提供されるドメイン知識)がAIエージェントの特定タスクにおけるパフォーマンスを実際に向上させるかどうかを、実証的に証明する方法を提供します。モデルにスキルをロードした場合とロードしない場合を並行して比較することで、「感覚に基づく」評価を排除します。

動作方法

スキルの設定で定義された各評価について、このツールは同じプロンプトを2回実行します:1回目は SKILL.md の内容をコンテキストに含める(with_skill)、もう1回は含めない(without_skill)。別途、ジャッジモデルが両方の出力を同じアサーションと期待される出力に対して評価し、それぞれの側について成功/失敗の結果を出力します。このシステムはOpenAI互換API、カスタムプロバイダーをサポートしており、ポータブルなJSON/JSONLアーティファクトや静的HTMLレポートとして結果を出力できます。

対象ユーザー

agentskills.io仕様に従ってAIエージェントを開発し、モデルに提供するドメイン知識を厳密かつ自動的にテスト・反復できる手段が必要な開発者。

主な特徴

  • スキル用A/Bテスト:ベースラインとスキル有効化プロンプトを直接比較し、パフォーマンス向上を測定。
  • ジャッジベースの評価:単純な文字列マッチではなく、引用付きのアサーションを提供するチャットモデルを使用。
  • 仕様準拠SKILL.md および evals.json について、agentskills.io仕様を完全に実装。
  • ツールコールアサーション:ツールコールを利用するエージェント向けの決定論的チェックをサポート。
  • 柔軟な統合:CI/CDパイプライン向けCLIと、カスタムダッシュボード向けTypeScript SDKの両方を提供。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト