canwhite/AgentEval

The agent responsible for conducting the agent evaluation

何を解決するか

AgentEval は、AIエージェントの監視、評価、デバッグを透明な方法で提供します。エージェントがタスクに失敗した理由を理解するのが難しいという課題を、エージェントとLLMの間の通信をキャプチャし、自動的にセッションに整理し、自動評価と根本原因分析を提供することで解決します。

動作方法

HTTPプロキシとして動作し、AIエージェントと上流のLLM APIの間に配置されます。すべての原始的な通信をキャプチャし、以下のステージで処理します:

  1. セッション検出:アイドルタイムアウトや新しい会話の開始を検出することで、トラフィックを個別のセッションに自動的に分割します。
  2. 評価:ルールベースのメトリクスとLLMジャッジを組み合わせて、タスク完了、ツール効率、応答品質、パフォーマンスの4つの次元でセッションをスコア付けします。
  3. 診断:10の特定のチェックを実行するルールエンジンにより、ツールチェーンの中断、リトライループ、トークンの無駄遣いなどの行動上の問題を検出します。
  4. プローブ:エージェントのソースコードディレクトリへの読み取り専用アクセスを持つLLMエージェントが、設定ファイル(プロンプト、スキル、ツール)をレビューし、診断された問題の根本原因を特定し、改善策を提案します。
  5. 可視化:すべての結果が組み込みのWebダッシュボードで簡単に確認できる形式で提供されます。

対象ユーザー

パフォーマンスの評価、行動上のバグの診断、プロンプトやツール設定の最適化が必要なAIエージェント開発者。

特徴

  • 透明なプロキシ:エージェントコードの変更は不要。BASE_URL を変更するだけでOK。
  • 多次元スコアリング:ハードルールとLLM判断を組み合わせて、包括的な0–1スコアを提供。
  • 自動根本原因分析:「プローブ」機能により、ソースコードを分析して失敗の理由を説明します。
  • 行動診断:専用のルールエンジンで特定の失敗パターン(例:静黙的失敗、重複するツール呼び出し)を検出。
  • 統合ダッシュボード:会話、スコア、診断レポートの構造化されたビューを提供。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト