JudgmentLabs/judgeval

The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.

해결하는 문제

Judgeval은 LLM 기반 에이전트의 개선이 어려운 점을 해결하기 위해, 정적 테스트 세트에 의존하지 않고 실제 운영 데이터를 사용하여 실패를 탐지하고, 근본 원인을 분석하며, 수정 사항의 유효성을 검증할 수 있는 방법을 제공합니다.

작동 방식

OpenTelemetry 기반 트레이싱을 사용하여 Python SDK로 에이전트 함수를 인스트루먼트화하여 입력, 출력, 토큰 사용량을 캡처합니다. 사용자는 "에이전트 점검자"라고 불리는 프롬프트 기반 스코어링을 정의할 수 있습니다. 이러한 점검자는 실시간 운영 트래픽(서버 측에서 지연 영향 없이) 또는 과거 트레이스를 재생하여 변경 사항이 실제로 문제를 해결했는지 검증할 수 있습니다.

대상 사용자

LLM 에이전트 및 AI 애플리케이션을 개발하고 있으며, 운영 수준의 가시성, 자동 평가, 에이전트 행동의 지속적 개선 루프가 필요한 개발자들입니다.

주요 기능

  • OpenTelemetry Tracing: @Tracer.observe()를 사용해 기존 가시성 스택과 완전 호환.
  • Agent Judges: 구조화된 프롬프트 기반 스코어링을 통해 시간이 지남에 따라 에이전트 행동을 레이블링하고 추적 가능.
  • 온라인 모니터링: 서버 측에서 실시간 트래픽을 스코어링하고, 회귀 시 Slack 알림 제공.
  • 광범위한 통합: OpenAI, Anthropic, Google GenAI, Together AI, LangGraph, OpenLit, Claude Agent SDK에 네이티브 지원.
  • JQL: 특정 트레이스와 스팬을 검색하기 위한 쿼리 언어.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트