canwhite/AgentEval

The agent responsible for conducting the agent evaluation

해결하는 문제

AgentEval은 AI 에이전트의 모니터링, 평가, 디버깅을 투명하게 제공합니다. 에이전트가 작업을 실패한 이유를 이해하기 어려운 문제를 해결하기 위해 에이전트와 LLM 사이의 트래픽을 캡처하고, 자동으로 세션으로 정리하며, 자동 평가와 근본 원인 분석을 제공합니다.

작동 방식

AI 에이전트와 상류 LLM API 사이에 위치하는 HTTP 프록시로 작동합니다. 모든 원시 트래픽을 캡처하고 다음과 같은 단계로 처리합니다:

  1. 세션 탐지: 유휴 타임아웃 또는 새로운 대화 시작을 감지하면 트래픽을 별도의 세션으로 자동 분할합니다.
  2. 평가: 규칙 기반 메트릭과 LLM 판정을 결합하여 태스크 완료, 도구 효율성, 응답 품질, 성능의 네 가지 차원에서 세션을 평가합니다.
  3. 진단: 10개의 특정 검사를 수행하는 규칙 엔진이 도구 체인 단절, 재시도 루프, 토큰 낭비와 같은 행동 문제를 탐지합니다.
  4. 프로빙: 에이전트의 소스 코드 디렉터리에 읽기 전용으로 접근하는 LLM 에이전트가 설정 파일(프롬프트, 기술, 도구)을 검토하여 진단된 문제의 근본 원인을 파악하고 개선 방안을 제안합니다.
  5. 시각화: 모든 결과는 내장된 웹 대시보드에서 쉽게 검토할 수 있도록 제공됩니다.

대상 사용자

성능 평가, 행동 버그 진단, 프롬프트 및 도구 설정 최적화가 필요한 AI 에이전트 개발자들입니다.

주요 기능

  • 투명한 프록시: 에이전트 코드 수정 없이 BASE_URL만 변경하면 됩니다.
  • 다차원 스코어링: 하드 규칙과 LLM 판단을 결합하여 포괄적인 0–1 점수를 제공합니다.
  • 자동 근본 원인 분석: "프로브" 기능은 소스 코드를 분석하여 실패의 이유를 설명합니다.
  • 행동 진단: 전용 규칙 엔진을 사용해 특정 실패 패턴(예: 침묵적 실패, 중복 도구 호출)을 탐지합니다.
  • 통합 대시보드: 대화, 점수, 진단 보고서의 구조화된 뷰를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트