LLM을 판사로 활용한 RAG 평가

Mistral AI는 "LLM as a Judge" 방식을 사용하여 검색 증강 생성(Retrieval-Augmented Generation, RAG) 시스템을 평가하는 방법론을 도입했습니다. 이 프레임워크를 통해 개발자는 특정하고 기계가 읽을 수 있는 기준에 따라 생성 LLM의 출력을 판사 LLM이 채점하도록 하여 평가 규모를 확장할 수 있습니다.

확장 가능한 평가를 위한 LLM as a Judge

LLM as a Judge는 인간 평가자가 없을 때 LLM 시스템을 대규모로 평가하기 위한 솔루션입니다. 이 설정에서 "판사 LLM"은 미리 정의된 척도(예: 숫자형(0-3 또는 1-10), 이진형(True/False), 또는 정성적(예: "Excellent"에서 "Bad") 등)를 사용하여 "생성 LLM"의 응답을 채점하도록 지시받습니다.

이를 구현하기 위해 개발자는 응답이 정확한지, 관련이 있는지, 또는 근거가 있는지와 같은 채점 기준을 정의하는 맞춤형 지침 프롬프트를 작성합니다. Mistral의 모델은 이러한 시스템의 생성 및 판사 구성 요소로 모두 사용될 수 있습니다.

RAG Triad 평가 프레임워크

단순한 일관성 확인을 넘어, Mistral은 RAG 시스템의 신뢰성과 문맥적 무결성을 평가하는 총체적인 프레임워크인 RAG Triad(TruLens에서 도입되었으며 RAGAS와 유사함)를 권장합니다. RAG Triad는 세 가지 특정 지표를 평가합니다:

1. Context Relevance

Context relevance는 검색된 문서가 사용자의 질문과 일치하는지 측정합니다. 이는 생성 LLM에 제공되는 정보가 유용한 답변을 생성하기에 적절하고 충분한지 확인합니다.

2. Groundedness

Groundedness는 생성된 응답이 검색된 문맥에 정확하게 기반하고 있는지 확인합니다. 이 지표는 출력이 사실적이고 소스 데이터에 충실하도록 보장함으로써 환각(hallucinations)을 줄이는 데 매우 중요합니다.

3. Answer Relevance

Answer relevance는 최종 응답이 사용자의 원래 질문을 얼마나 잘 해결하는지 평가하며, 출력이 사용자의 의도와 일치하고 가치 있는 통찰력을 제공하는지 확인합니다.

구조화된 출력을 통한 평가 구현

Mistral AI는 "structured outputs" API 기능을 활용하여 LLM-as-a-judge 프로세스를 더욱 신뢰할 수 있고 기계가 읽을 수 있도록 만듭니다. 판사의 응답에 특정 스키마를 강제함으로써, 개발자는 평가 결과가 일관되고 프로그래밍 방식으로 처리하기 쉽도록 보장할 수 있습니다.

Pydantic 모델을 사용하여, Mistral은 판사 LLM이 단계별 추론 설명과 세 가지 Triad 지표(context relevance, answer relevance, groundedness) 각각에 대한 점수를 모두 제공하도록 요구하는 RAGEvaluation 스키마를 정의하는 방법을 보여줍니다.

결론

RAG Triad 프레임워크와 구조화된 출력을 결합하면 RAG 시스템에 대한 강력한 엔드 투 엔드(end-to-end) 평가가 가능해집니다. 이 접근 방식은 검색과 생성 단계를 모두 평가하여, 인간, AI, 그리고 지식 베이스 사이의 최종 상호작용이 정확하고 신뢰할 수 있음을 보장합니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트