Arize Phoenix와 함께 smolagents 추적 및 평가

Hugging Face는 Arize Phoenixsmolagents 라이브러리와 통합하여 AI 에이전트의 실시간 가시성과 체계적인 평가를 제공하는 워크플로우를 자세히 설명합니다. 이 통합을 통해 개발자는 에이전트의 단계별 의사결정 과정을 시각화하고, LLM 기반 판정을 사용해 도구 출력의 관련성 및 정확성을 측정할 수 있습니다.

에이전트 가시성을 위한 실시간 추적

추적은 에이전트 내부 워크플로우를 세밀하게 보여주어, 개발자가 도구 호출부터 최종 응답 생성까지 모든 단계를 추적함으로써 문제를 디버깅하고 성능을 최적화할 수 있게 합니다.

smolagents에서 추적을 구현하려면 OpenTelemetryOpenInference를 사용해 계측하고, 시각화 플랫폼으로 Arize Phoenix를 활용합니다. 설정 과정은 smolagents[telemetry] 모듈을 설치하고 Phoenix 인스턴스를 가리키는 트레이서 제공자를 등록하는 것을 포함합니다. 구성 후에는 모든 에이전트 호출이 자동으로 Phoenix 대시보드에 트레이스로 캡처되어, 에이전트 의사결정 과정을 "X‑ray"처럼 볼 수 있습니다.

LLM‑as‑a‑Judge를 통한 체계적 평가

평가(evals)는 에이전트가 정보를 얼마나 효과적으로 검색·처리·제시하는지를 측정합니다. 주요 방법은 "LLM‑as‑a‑judge" 접근법으로, 고성능 모델(예: GPT‑4o)을 사용해 다른 모델이나 도구의 성능을 점수화합니다.

도구 관련성 평가

실제 구현에서는 검색 도구(예: DuckDuckGoSearchTool)의 관련성을 다음 단계로 평가할 수 있습니다:

  1. 실행 스팬 가져오기: SpanQuery를 사용해 도구가 호출된 특정 트레이스를 추출하고 입력(쿼리)과 출력(결과)을 분리합니다.
  2. 프롬프트 템플릿 적용: RAG_RELEVANCY_PROMPT_TEMPLATE과 같은 특수 프롬프트 템플릿을 사용해 판정 LLM을 안내합니다.
  3. 결과 분류: 판정 LLM이 입력과 출력을 분석해 결과를 "관련" 또는 "무관"으로 분류합니다.
  4. 결과 로그: 이진 점수(관련=1, 무관=0)를 Arize Phoenix에 다시 기록해 체계적인 분석이 가능하도록 합니다.

다목적 평가 템플릿

Arize Phoenix는 다양한 에이전트 유형과 사용 사례에 맞게 적용할 수 있는 사전 작성·테스트된 평가 템플릿 라이브러리를 제공합니다. 프롬프트 템플릿만 교체하면 단순 관련성을 넘어 다양한 성능 지표를 측정할 수 있습니다.

평가 템플릿 적용 가능한 에이전트 유형
환각 탐지 RAG 에이전트, 일반 챗봇, 지식 기반 어시스턴트
검색된 데이터에 대한 Q&A RAG 에이전트, 연구 어시스턴트, 문서 검색 도구
RAG 관련성 RAG 에이전트, 검색 기반 AI 어시스턴트
요약 요약 도구, 문서 다이제스트, 회의록 생성기
코드 생성 코드 어시스턴트, AI 프로그래밍 봇
독성 탐지 모더레이션 봇, 콘텐츠 필터링 AI
AI vs Human (Ground Truth) 평가·벤치마킹 도구, AI 생성 콘텐츠 검증기
참조(인용) 링크 연구 어시스턴트, 인용 도구, 학술 작문 보조
SQL 생성 평가 데이터베이스 쿼리 에이전트, SQL 자동화 도구
에이전트 함수 호출 평가 다단계 추론 에이전트, API 호출 AI, 작업 자동화 봇

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트