JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
TITLE:
它解决了什么
Judgeval 为 LLM 驱动的代理提供持续改进堆栈。它帮助开发者使用生产数据检测故障、定位根本原因并验证修复,确保代理行为随时间被监控和改进。
它是如何工作的
该系统使用基于 OpenTelemetry 的追踪系统来捕获代理函数的输入、输出和 token 使用情况。它采用“基于提示的评分器”(agent judges)来大规模评估代理行为。这些评分器可以针对实时生产流量运行,或在历史追踪上重放以验证修复。此外,它还提供带有服务器端评分的在线监控,零延迟影响,并在出现回归时通过 Slack 警报开发者。
适用人群
构建 LLM 驱动的应用和代理的开发者,他们需要一种方法来追踪代理的执行路径,并使用生产数据系统地评估其性能。
亮点
- 基于 OpenTelemetry 的追踪:使用简单的装饰器装配函数以捕获执行数据。
- 代理评判员:使用基于提示的评分器来创建代理行为的结构化记录。
- 在线监控:服务器端对实时流量进行评分,零延迟影响,并在出现回归时通过 Slack 警报。
- 广泛集成:支持主要的 LLM 提供商(OpenAI、Anthropic、Google GenAI、Together AI)以及如 LangGraph 和 Claude Agent SDK 等框架。
- MCP 服务器:连接到 MCP 兼容的 AI 工具,直接在 IDE 或 AI 助手中暴露故障。