Digital Green Farmer.chat: LLM-as-a-Judge로 RAG 강화

Digital Green은 Farmer.chat(리트리벌-증강 생성 기반 농업 챗봇)을 위해 LLM-as-a-judge 평가 프레임워크를 구현하여 RAG 정확성을 객관적으로 측정하고 34만 건의 질의에 걸쳐 모델 선택을 최적화했습니다.

농업 지원을 위한 시스템 아키텍처

지식 베이스 구축

  • Preprocessing: PDF 문서는 Scio API를 통해 수집되며, 주제는 지리적 영역별로 자동 분류되고 의미적으로 그룹화됩니다.
  • Semantic Chunking: 텍스트는 의미가 유사한 문장들을 작은 텍스트 임베딩과 코사인 유사도를 사용해 함께 그룹화하여 청크로 처리됩니다.
  • Vector Storage: 청크는 벡터 표현으로 변환되어 QdrantDB에 저장됩니다.

RAG 파이프라인 및 사용자 에이전트

  • Information Retrieval: 시스템은 사용자의 질의와 일치하는 텍스트 청크를 찾기 위해 벡터 데이터베이스를 검색합니다.
  • Generation: LLM은 검색된 청크와 사용자 질의를 사용해 인간과 같은 응답을 생성합니다.
  • User-facing Agent: GPT-4o 기반의 이 플래닝 에이전트는 ReAct 기반 프롬프트를 사용해 사용자 의도를 파악하고, 누락된 정보를 요청하며, 실행 도구를 호출합니다. 사용 가능한 도구에는 RAG QA 엔드포인트, 비디오 검색, 날씨 엔드포인트, 작물 테이블이 포함됩니다.

평가를 위한 LLM-as-a-Judge 구현

주요 평가 지표

  • Prompt Clarity: 의도 명확성, 주제 구체성, 엔터티-속성 식별을 기준으로 1-3 점수로 사용자 입력을 평가합니다.
  • Question Type: 질의를 기억, 이해, 적용, 분석, 평가, 창작의 여섯 가지 인지 복잡도 범주로 분류합니다.
  • Answered Queries: 챗봇이 성공적으로 답변한 질문 비율을 추적해 지식 베이스의 격차를 파악합니다.
  • RAG Accuracy: 응답이 제공된 컨텍스트에서 사실적으로 도출되었는지를 0 또는 1의 이진 지표로 평가합니다. 이 방법은 약 360개의 테스트 질문에 대해 인간 평가와 높은 상관관계를 보였습니다.

RAG Accuracy 프롬프트

신뢰성을 평가하기 위해 시스템은 RAGAS 라이브러리에서 영감을 받은 자연어 추론 프롬프트를 사용합니다. 판정 LLM은 응답에서 생성된 원자적 사실 진술을 분석하고 이를 검색된 컨텍스트와 비교하여, 진술이 컨텍스트에서 도출될 수 있으면 1을, 그렇지 않으면 0을 부여합니다.

RAG 성능을 위한 LLM 벤치마킹

Digital Green은 다양한 작물과 시기에 걸쳐 700개 이상의 무작위 사용자 질의 데이터셋을 테스트하여 GPT-4-Turbo, Llama-3-70B-Instruct, Gemini-1.5-Pro, Gemini-1.5-Flash 네 가지 주요 LLM을 비교했습니다.

LLM 신뢰성 관련성 답변 * 관련성 답변 * 신뢰성 미답변
GPT-4-turbo 88% 75% 59% 69% 21.9%
Llama-3-70B 78% 76% 76% 78% 0.3%
Gemini-1.5-Pro 91% 88% 71% 73% 19.4%
Gemini-1.5-Flash 89% 78% 74% 85% 4.5%

주요 발견:

  • Highest Faithfulness: Gemini-1.5-Pro가 가장 높은 사실 정확도(91%)를 달성했습니다.
  • Best Trade-off: Gemini-1.5-Flash는 높은 신뢰성(89%)과 낮은 미답변 비율(4.5%)의 우수한 균형으로 인해 프로덕션에 선택되었습니다.

영향 및 결과

LLM-as-a-judge 지표에 의해 안내된 1년간의 반복 개발을 통해 Farmer.chat은 다음과 같은 주요 성과를 달성했습니다:

  • Reach: 20,000명 이상의 농민에게 서비스를 제공했습니다.
  • Volume: 340,000건 이상의 질의를 처리했습니다.
  • Scale: 6개 이상의 언어와 50가지 가치 사슬 작물을 지원했습니다.
  • Safety: 편향이나 유해 응답이 거의 없도록 유지했습니다.

Sources