JudgmentLabs/judgeval

The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.

解决的问题

Judgeval 通过提供一种方法,利用真实生产数据而非依赖静态测试集,来检测失败、分析根本原因并验证修复方案,解决了 LLM 驱动的智能体改进困难的问题。

工作原理

它使用 Python SDK 通过基于 OpenTelemetry 的追踪来对智能体函数进行插桩,捕获输入、输出和 token 使用情况。用户可以定义“智能体评判者”——基于提示的评分器,用于大规模评估智能体行为。这些评判者可以针对实时生产流量运行(服务器端执行,无延迟影响),或在历史追踪数据上回放,以验证更改是否真正解决了已识别的问题。

适用人群

需要生产级可观测性、自动化评估以及智能体行为持续改进循环的 LLM 智能体和 AI 应用开发者。

核心亮点

  • OpenTelemetry 追踪:与现有可观测性栈完全兼容,使用 @Tracer.observe()
  • 智能体评判者:结构化、基于提示的评分机制,用于随时间追踪和标记智能体行为。
  • 在线监控:服务器端对实时流量进行评分,并在出现回归时通过 Slack 发送告警。
  • 广泛集成:原生支持 OpenAI、Anthropic、Google GenAI、Together AI、LangGraph、OpenLit 和 Claude Agent SDK。
  • JQL:用于检索特定追踪和跨度的查询语言。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目