canwhite/AgentEval
The agent responsible for conducting the agent evaluation
解決的問題
AgentEval 提供了一種透明的方式來監控、評估和除錯 AI 代理。它解決了難以理解代理為何失敗的問題,透過捕獲代理與 LLM 之間的通訊,自動將其組織為會話,並提供自動評分與根本原因分析。
工作原理
它作為一個 HTTP 代理運行在您的 AI 代理與上游 LLM API 之間。它捕獲所有原始流量,並透過多個階段進行處理:
- 會話檢測:根據閒置超時或偵測到新對話開始,自動將流量拆分為不同的會話。
- 評分:結合規則指標與 LLM 判定,從任務完成度、工具效率、回應品質、效能四個維度對會話進行評分。
- 診斷:規則引擎執行 10 項特定檢查,以檢測工具鏈中斷、重試循環或 Token 浪費等行為問題。
- 探查:一個具有唯讀權限存取代理原始碼目錄的 LLM 代理,會審查設定檔(提示詞、技能、工具),以識別診斷問題的根本原因並提出改進建議。
- 可視化:所有結果均透過內建 Web 仪表板呈現,便於審查。
適用對象
需要系統化方式評估效能、診斷行為錯誤並優化提示詞與工具設定的 AI 代理開發者。
主要亮點
- 透明代理:無需修改代理程式碼;只需變更
BASE_URL即可。 - 多維度評分:結合硬規則與 LLM 判定,提供全面的 0–1 分數。
- 自動根本原因分析:「探查」功能分析原始碼,解釋失敗的原因。
- 行為診斷:透過專用規則引擎檢測特定失敗模式(例如:靜默失敗、重複工具呼叫)。
- 整合儀表板:提供對話、評分與診斷報告的結構化視圖。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案