허깅 페이스 오픈 LLM 리더보드 MMLU 평가 분석
허깅 페이스는 오픈 LLM 리더보드의 MMLU(대규모 다중 작업 언어 이해) 점수에서 발생하는 차이—특히 LLaMA 모델에 대해—가 다양한 평가 라이브러리에서 벤치마크가 구현되는 방식의 차이에서 비롯된다고 파악했습니다. 이는 LLM 평가 결과가 프롬프트 형식과 예측을 추출하는 방법과 같은 미세한 세부 사항에 매우 민감하다는 것을 강조합니다.
구현이 MMLU 점수에 미치는 영향
같은 MMLU 데이터셋의 다양한 소프트웨어 구현은 ampliamente 다른 절대 점수를 생성하고 모델의 순위를 변경할 수 있습니다. 허깅 페이스는 세 가지 특정 구현을 비교했습니다:
- Original Implementation: MMLU를 개발한 UC 버클리 팀이 제안한 코드.
- HELM Implementation: 스탠퍼드의 Holistic Evaluation of Language Models(HELM)에서 제공한 코드.
- EleutherAI LM Evaluation Harness: 오픈 LLM 리더보드의 백엔드로 사용되는 라이브러리.
비교 결과, LLaMA-65B와 같은 모델은 Original 구현에서는 0.636점을 받았지만 Harness 구현에서는 0.488점을 받았습니다. 이러한 차이(약 30%)는 실제로는 평가 방법론 때문인데도 연구자들이 모델이 poorly 훈련되었다고 오해하게 만들 수 있습니다.
평가 방법의 기술적 차이
차이는 두 가지 주요 영역에서 발생합니다: 프롬프트 구성과 점수 계산 방법.
프롬프트 변형
입력 문자열의 작은 변화라도 모델 출력에 영향을 미칩니다. 세 가지 구현 사이에서 관찰된 차이는 다음과 같습니다:
- Instructions: 도입 문장과 토픽 라인 포함 여부의 변형.
- Prefixes: 질문이 "Question:" 라벨로 선행되는지 여부.
- Choice Formatting: 다중 선택 옵션이 "Choices" 키워드로 선행되는지 여부.
예측 추출 방법
이 라이브러리들이 모델에서 답을 추출하는 세 가지 distint한 방법이 있습니다:
- Letter Probability Comparison (Original): 모델의 단일 토큰 "A", "B", "C", "D"에 대한 예측 확률을 비교합니다. 이 네 개 중 가장 높은 확률이 승리하며, 모델이 완전히 다른 단어를 생성하기를 선호하더라도 그렇습니다.
- Text Generation Comparison (HELM): 모델이 텍스트 응답을 생성하고,これが 예상된 letter 답변과 비교됩니다. 모델이 예상된 letter 이외의 단어를 생성하면(예: "Zygote)) 오답으로 처리됩니다.
- Full Sequence Probability (Harness - Jan 2023): 라이브러리는 전체 답변 시퀀스(예: "C. The second pharyngeal arch))의 확률을 비교합니다. 이는 시퀀스의 각 토큰 확률의 로그를 합산하는 과정을 포함합니다.
평가 접근 방식 요약
| Implementation | 비교 방법 |
|---|---|
| Original | letter 답변(A, B, C, D)의 확률을 비교 |
| HELM | 모델이 letter 답변을 텍스트로 생성하도록 기대 |
| AI Harness (Jan 2023) | 전체 답변 시퀀스(Letter + Text)의 확률을 비교 |
결론 및 향후 업데이트
평가 결과는 절대적이지 않으며 특정 구현, 토큰화, 프롬프트에 종속됩니다. 공정한 비교를 위해 허깅 페이스는 EleutherAI Eval Harness와 Stanford HELM과 같은 오픈, 표준화, 재현 가능한 벤치마크의 필요성을 강조합니다.
관측된 차이를 해결하기 위해 EleutherAI Harness가 원본 구현과 더 가깝게 MMLU 평가를 맞추도록 업데이트되었습니다. 허깅 페이스는 현재 업데이트된 EleutherAI Eval Harness v2를 사용하여 이러한 변경 사항을 반영하도록 오픈 LLM 리더보드를 업데이트 중입니다.}