JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
解决的问题
Judgeval 通过提供一种方法,利用真实生产数据而非依赖静态测试集,来检测失败、分析根本原因并验证修复方案,解决了 LLM 驱动的智能体改进困难的问题。
工作原理
它使用 Python SDK 通过基于 OpenTelemetry 的追踪来对智能体函数进行插桩,捕获输入、输出和 token 使用情况。用户可以定义“智能体评判者”——基于提示的评分器,用于大规模评估智能体行为。这些评判者可以针对实时生产流量运行(服务器端执行,无延迟影响),或在历史追踪数据上回放,以验证更改是否真正解决了已识别的问题。
适用人群
需要生产级可观测性、自动化评估以及智能体行为持续改进循环的 LLM 智能体和 AI 应用开发者。
核心亮点
- OpenTelemetry 追踪:与现有可观测性栈完全兼容,使用
@Tracer.observe()。 - 智能体评判者:结构化、基于提示的评分机制,用于随时间追踪和标记智能体行为。
- 在线监控:服务器端对实时流量进行评分,并在出现回归时通过 Slack 发送告警。
- 广泛集成:原生支持 OpenAI、Anthropic、Google GenAI、Together AI、LangGraph、OpenLit 和 Claude Agent SDK。
- JQL:用于检索特定追踪和跨度的查询语言。
相关
- 项目
- 项目
- 项目
- 项目
- 项目