Arize Phoenix와 함께 smolagents 추적 및 평가
Hugging Face는 Arize Phoenix를 smolagents 라이브러리와 통합하여 AI 에이전트의 실시간 가시성과 체계적인 평가를 제공하는 워크플로우를 자세히 설명합니다. 이 통합을 통해 개발자는 에이전트의 단계별 의사결정 과정을 시각화하고, LLM 기반 판정을 사용해 도구 출력의 관련성 및 정확성을 측정할 수 있습니다.
에이전트 가시성을 위한 실시간 추적
추적은 에이전트 내부 워크플로우를 세밀하게 보여주어, 개발자가 도구 호출부터 최종 응답 생성까지 모든 단계를 추적함으로써 문제를 디버깅하고 성능을 최적화할 수 있게 합니다.
smolagents에서 추적을 구현하려면 OpenTelemetry와 OpenInference를 사용해 계측하고, 시각화 플랫폼으로 Arize Phoenix를 활용합니다. 설정 과정은 smolagents[telemetry] 모듈을 설치하고 Phoenix 인스턴스를 가리키는 트레이서 제공자를 등록하는 것을 포함합니다. 구성 후에는 모든 에이전트 호출이 자동으로 Phoenix 대시보드에 트레이스로 캡처되어, 에이전트 의사결정 과정을 "X‑ray"처럼 볼 수 있습니다.
LLM‑as‑a‑Judge를 통한 체계적 평가
평가(evals)는 에이전트가 정보를 얼마나 효과적으로 검색·처리·제시하는지를 측정합니다. 주요 방법은 "LLM‑as‑a‑judge" 접근법으로, 고성능 모델(예: GPT‑4o)을 사용해 다른 모델이나 도구의 성능을 점수화합니다.
도구 관련성 평가
실제 구현에서는 검색 도구(예: DuckDuckGoSearchTool)의 관련성을 다음 단계로 평가할 수 있습니다:
- 실행 스팬 가져오기:
SpanQuery를 사용해 도구가 호출된 특정 트레이스를 추출하고 입력(쿼리)과 출력(결과)을 분리합니다. - 프롬프트 템플릿 적용:
RAG_RELEVANCY_PROMPT_TEMPLATE과 같은 특수 프롬프트 템플릿을 사용해 판정 LLM을 안내합니다. - 결과 분류: 판정 LLM이 입력과 출력을 분석해 결과를 "관련" 또는 "무관"으로 분류합니다.
- 결과 로그: 이진 점수(관련=1, 무관=0)를 Arize Phoenix에 다시 기록해 체계적인 분석이 가능하도록 합니다.
다목적 평가 템플릿
Arize Phoenix는 다양한 에이전트 유형과 사용 사례에 맞게 적용할 수 있는 사전 작성·테스트된 평가 템플릿 라이브러리를 제공합니다. 프롬프트 템플릿만 교체하면 단순 관련성을 넘어 다양한 성능 지표를 측정할 수 있습니다.
| 평가 템플릿 | 적용 가능한 에이전트 유형 |
|---|---|
| 환각 탐지 | RAG 에이전트, 일반 챗봇, 지식 기반 어시스턴트 |
| 검색된 데이터에 대한 Q&A | RAG 에이전트, 연구 어시스턴트, 문서 검색 도구 |
| RAG 관련성 | RAG 에이전트, 검색 기반 AI 어시스턴트 |
| 요약 | 요약 도구, 문서 다이제스트, 회의록 생성기 |
| 코드 생성 | 코드 어시스턴트, AI 프로그래밍 봇 |
| 독성 탐지 | 모더레이션 봇, 콘텐츠 필터링 AI |
| AI vs Human (Ground Truth) | 평가·벤치마킹 도구, AI 생성 콘텐츠 검증기 |
| 참조(인용) 링크 | 연구 어시스턴트, 인용 도구, 학술 작문 보조 |
| SQL 생성 평가 | 데이터베이스 쿼리 에이전트, SQL 자동화 도구 |
| 에이전트 함수 호출 평가 | 다단계 추론 에이전트, API 호출 AI, 작업 자동화 봇 |
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- 프로젝트