Hugging Face Judge Arena: LLM을 평가자로 벤치마킹하기
Hugging Face는 평가자로서 가장 효과적인 LLM을 식별하기 위해 설계된 크라우드소싱 플랫폼인 Judge Arena를 출시했습니다. 이 도구는 AI 모델이 다른 AI 애플리케이션의 자연어 출력을 채점하는 "LLM-as-a-Judge" 방식에 어떤 모델이 가장 적합한지 결정해야 하는 중요한 요구를 해결합니다.
크라우드소싱 평가 프레임워크
Judge Arena는 AI 판사를 벤치마킹하기 위해 무작위 사이드 바이 사이드(side-by-side) 배틀 시스템을 활용합니다. 이 방법론은 LMSys의 Chatbot Arena와 같은 플랫폼에서 볼 수 있는 크라우드소싱 벤치마킹의 성공에 기반합니다. 객관적인 결과를 보장하기 위해 프로세스는 특정 워크플로우를 따릅니다:
- 샘플 선택: 사용자는 시스템이 무작위로 생성한 User Input/AI Response 쌍을 선택하거나 커스텀 샘플을 제공하여 평가를 위한 샘플을 선택합니다.
- 이중 평가: 두 개의 익명 LLM 판사가 응답에 점수를 매기고 점수에 대한 상세한 이유를 제공합니다.
- 사용자 투표: 사용자는 점수와 비평을 검토하고 자신의 판단과 가장 잘 일치하는 평가를 내린 판사에게 투표합니다.
편향과 남용을 방지하기 위해 모델의 정체성은 투표가 제출될 때까지 숨겨집니다.
모델 선정 기준
Judge Arena는 점수만 출력하는 분류기(classifier) 모델을 제외하고 생성형 모델에만 집중합니다. 아레나에 포함되려면 모델은 두 가지 주요 기준을 충족해야 합니다:
- 채점 및 비평 능력: 모델은 다른 모델의 출력에 대해 효과적으로 점수를 매기고 비평을 제공할 수 있어야 합니다.
- 프롬프트 가능성(Prompt-ability): 모델은 다양한 채점 형식과 기준을 사용하여 평가하도록 프롬프트를 입력받을 수 있어야 합니다.
현재 플랫폼에는 다음과 같은 독점 및 오픈 소스 제공업체의 최첨단 LLM 18개가 포함되어 있습니다:
- OpenAI: GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo
- Anthropic: Claude 3.5 Sonnet / Haiku, Claude 3 Opus / Sonnet / Haiku
- Meta: Llama 3.1 Instruct Turbo (405B, 70B, 8B)
- Alibaba: Qwen 2.5 Instruct Turbo (7B, 72B), Qwen 2 Instruct 72B
- Google: Gemma 2 (9B, 27B)
- Mistral: Instruct v0.3 7B, Instruct v0.1 7B
성능 지표 및 초기 통찰
Judge Arena는 Elo 레이팅 시스템을 사용하여 각 모델의 점수를 계산하며, 리더보드는 매시간 업데이트됩니다. 플랫폼의 초기 관찰 결과 몇 가지 주요 트렌드가 나타났습니다:
- 경쟁력 있는 오픈 소스 성능: 현재 GPT-4 Turbo가 근소한 차이로 앞서고 있지만, Llama 및 Qwen 모델은 매우 경쟁력이 있으며 대부분의 독점 모델을 능가합니다.
- 소형 모델의 효율성: Qwen 2.5 7B와 Llama 3.1 8B는 훨씬 더 큰 모델들과 효과적으로 경쟁하며 인상적인 성능을 보여주었습니다.
- Llama의 기반 모델로서의 검증: 예비 결과에 따르면 Llama 3.1 70B와 405B가 각각 2위와 3위를 차지했습니다. 이는 Llama 모델이 평가 작업에 강력한 베이스 모델임을 시사하는 기존 연구(Lynx, Auto-J, SFR-LLaMA-3.1-Judge 등)와 일치합니다.
커뮤니티 기여 및 데이터 공유
더 잘 정렬된(aligned) 평가자를 개발하기 위해 Hugging Face와 Atla는 향후 몇 달 동안 익명화된 투표 데이터의 20%를 공유하기로 약속했습니다. 플랫폼은 커뮤니티의 피드백과 리더보드에 추가할 새로운 모델에 대한 제안을 환영합니다.