canwhite/AgentEval
The agent responsible for conducting the agent evaluation
解决的问题
AgentEval 提供了一种透明的方式来监控、评估和调试 AI 代理。它解决了难以理解代理为何失败的问题,通过捕获代理与 LLM 之间的通信,自动将其组织为会话,并提供自动评分和根本原因分析。
工作原理
它作为一个 HTTP 代理运行在您的 AI 代理和上游 LLM API 之间。它捕获所有原始流量,并通过多个阶段进行处理:
- 会话检测:根据空闲超时或检测到新对话开始,自动将流量拆分为不同的会话。
- 评分:结合规则指标和 LLM 判定,从任务完成度、工具效率、响应质量、性能四个维度对会话进行评分。
- 诊断:规则引擎运行 10 项特定检查,以检测工具链中断、重试循环或令牌浪费等行为问题。
- 探查:一个具有只读权限访问代理源代码目录的 LLM 代理,会审查配置文件(提示词、技能、工具),以识别诊断问题的根本原因并提出改进建议。
- 可视化:所有结果均通过内置 Web 仪表板呈现,便于审查。
适用人群
需要系统化方式评估性能、诊断行为错误并优化提示词和工具配置的 AI 代理开发者。
主要亮点
- 透明代理:无需修改代理代码;只需更改
BASE_URL即可。 - 多维度评分:结合硬规则与 LLM 判断,提供全面的 0–1 分数。
- 自动根本原因分析:"探查" 功能分析源代码,解释失败的原因。
- 行为诊断:通过专用规则引擎检测特定失败模式(例如:静默失败、重复工具调用)。
- 集成仪表板:提供对话、评分和诊断报告的结构化视图。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目