JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
TITLE:
무엇인가 해결
Judgeval은 LLM 기반 에이전트를 위한 지속적 개선 스택을 제공합니다. 개발자가 프로덕션 데이터를 사용하여 실패를 감지하고 근본 원인을 triage하며 수정을 검증하도록 도와주며, 에이전트 동작이 시간이 지남에 따라 모니터링되고 개선되도록 보장합니다.
어떻게 작동하나요
이 시스템은 OpenTelemetry 기반 트레이싱 시스템을 사용하여 에이전트 함수의 입력, 출력 및 토큰 사용량을 캡처합니다. 프롬프트 기반 스코어러인 "에이전트 판사"를 활용하여 대규모로 에이전트 동작을 평가합니다. 이러한 판사는 라이브 프로덕션 트래픽에 대해 실행하거나 과거 트레이스를 재생하여 수정을 검증할 수 있습니다. 또한, 서버 측 스코어링을 통한 온라인 모니터링을 제공하여 회귀가 발생했을 때 Slack을 통해 개발자에게 경고합니다.
누가 사용하나요
프로덕션 데이터를 사용하여 에이전트의 실행 경로를 추적하고 성능을 체계적으로 평가해야 하는 LLM 기반 애플리케이션 및 에이전트를 구축하는 개발자.
주요 기능
- OpenTelemetry-based tracing: 간단한 데코레이터로 함수를 계측하여 실행 데이터를 캡처합니다.
- Agent judges: 프롬프트 기반 스코어러를 사용하여 에이전트 동작의 구조화된 레코드를 생성합니다.
- Online monitoring: 지연 영향 없이 라이브 트래픽에 대한 서버 측 스코어링과 회귀 시 Slack 알림을 제공합니다.
- Broad integrations: 주요 LLM 제공업체(OpenAI, Anthropic, Google GenAI, Together AI)와 LangGraph, Claude Agent SDK 같은 프레임워크를 지원합니다.
- MCP Server: MCP 호환 AI 도구와 연결하여 IDE 또는 AI 어시스턴트에서 직접 실패를 표시합니다.