canwhite/AgentEval

The agent responsible for conducting the agent evaluation

解決的問題

AgentEval 提供了一種透明的方式來監控、評估和除錯 AI 代理。它解決了難以理解代理為何失敗的問題,透過捕獲代理與 LLM 之間的通訊,自動將其組織為會話,並提供自動評分與根本原因分析。

工作原理

它作為一個 HTTP 代理運行在您的 AI 代理與上游 LLM API 之間。它捕獲所有原始流量,並透過多個階段進行處理:

  1. 會話檢測:根據閒置超時或偵測到新對話開始,自動將流量拆分為不同的會話。
  2. 評分:結合規則指標與 LLM 判定,從任務完成度、工具效率、回應品質、效能四個維度對會話進行評分。
  3. 診斷:規則引擎執行 10 項特定檢查,以檢測工具鏈中斷、重試循環或 Token 浪費等行為問題。
  4. 探查:一個具有唯讀權限存取代理原始碼目錄的 LLM 代理,會審查設定檔(提示詞、技能、工具),以識別診斷問題的根本原因並提出改進建議。
  5. 可視化:所有結果均透過內建 Web 仪表板呈現,便於審查。

適用對象

需要系統化方式評估效能、診斷行為錯誤並優化提示詞與工具設定的 AI 代理開發者。

主要亮點

  • 透明代理:無需修改代理程式碼;只需變更 BASE_URL 即可。
  • 多維度評分:結合硬規則與 LLM 判定,提供全面的 0–1 分數。
  • 自動根本原因分析:「探查」功能分析原始碼,解釋失敗的原因
  • 行為診斷:透過專用規則引擎檢測特定失敗模式(例如:靜默失敗、重複工具呼叫)。
  • 整合儀表板:提供對話、評分與診斷報告的結構化視圖。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案