Hugging Face 환각 리더보드 출시 및 초기 결과

TL;DR

Hugging Face Hallucinations Leaderboard는 사실성 및 충실도 환각에 대한 대규모 언어 모델을 오픈소스 데이터셋 모음으로 벤치마크하기 위해 출시되었으며, 투명하고 지속적으로 업데이트되는 순위를 제공하여 연구자들이 가장 신뢰할 수 있는 모델을 식별하도록 돕습니다.

리더보드가 측정하는 항목

리더보드는 EleutherAI LM Evaluation Harness를 사용하여 환각 관련 벤치마크에 대해 모델을 평가합니다. 모든 지표는 ([0,1]) 범위로 정규화되며, 점수가 높을수록 환각이 적음을 나타냅니다. 평가는 에든버러 국제 데이터 시설과 에든버러 대학 내부 클러스터의 NVIDIA A100 GPU에서 수행됩니다.

벤치마크 스위트

리더보드는 8개의 작업군을 집계하며, 각각은 특정 환각 실패 유형을 목표로 합니다:

  • Closed‑book Open‑Domain QA – NQ Open, TriviaQA, TruthfulQA (8‑shot 및 64‑shot 설정). 정확도는 Exact Match로 측정됩니다.
  • Summarisation – XSum 및 CNN/DM (2‑shot). 지표: ROUGE‑1/2/L, factKB, 그리고 BERTScore‑Precision.
  • Reading Comprehension – RACE (2‑shot) 및 SQuADv2 (4‑shot). 답변 선택 및 답변 불가능 질문 탐지를 평가합니다.
  • Instruction Following – MemoTrap (zero‑shot) 및 IFEval (zero‑shot). 모델이 원하지 않는 텍스트를 기억하지 않고 제약을 준수하는지를 테스트합니다.
  • Fact‑Checking – FEVER (16‑shot). 모델은 SUPPORTS, REFUTES, 또는 NOT ENOUGH INFO를 예측합니다.
  • Hallucination Detection – FaithDial, True‑False, HaluEval (QA/Dialogue/Summarisation) 8‑shot 설정에서. 모델은 환각된 출력을 표시해야 합니다.
  • Self‑Consistency – SelfCheckGPT (238 인스턴스). 각 인스턴스당 여섯 개의 패시지를 생성(하나는 결정적, 다섯 개는 확률적)하고 NLI 모델을 사용해 일관성 없는 문장을 표시합니다.

예비 결과

모델 클러스터

결과 행렬에 대한 계층적 클러스터링은 세 개의 자연스러운 그룹을 드러냅니다:

  1. Mistral 7B‑based models (예: Mistral 7B‑OpenOrca, Zephyr 7B beta, Starling‑LM 7B alpha).
  2. LLaMA 2‑based models (예: LLaMA 2 7B, LLaMA 2 13B, Wizard Vicuna 13B).
  3. Smaller models (예: BLOOM 560M, GPT‑Neo 125M, Orca Mini 3B).

Closed‑book QA

  • Mistral 7B 변형이 TriviaQA (8‑shot)와 TruthfulQA에서 다른 모델보다 우수합니다.
  • Falcon 7B가 NQ Open (8‑shot)에서 선두를 차지합니다. 64‑shot으로 늘리면 LLaMA 2 13B가 최고 위치로 상승합니다 (EM = 0.34).

Instruction following

  • 놀랍게도, BLOOM 560M이 MemoTrap에서 상위에 랭크되어 작은 모델이 유명 인용구를 기억하지 않는다는 것을 시사합니다.
  • LLaMA 2 13B Chat와 Mistral 7B Instruct가 더 복잡한 IFEval 작업에서 가장 높은 점수를 얻었습니다.

Summarisation

  • GPT‑JT 6B가 CNN/DM에서 가장 높은 ROUGE 점수를 달성했으며, 주로 앞 문장을 추출함으로써 얻었습니다.
  • LLaMA 2 13B는 성능이 낮으며, 종종 한 토큰 뒤에 출력을 잘라내는데, 이는 컨텍스트 길이 제한 때문인 것으로 보입니다.

Reading comprehension

  • Mistral 7B와 LLaMA 2 모델이 RACE에서 선두를 차지합니다.
  • SQuADv2에서는 mGPT가 답변 불가능 질문 탐지에 뛰어나고, Starling‑LM 7B alpha가 답변 가능한 질문에 가장 잘 답합니다.

Hallucination detection

  • SelfCheckGPT 점수는 Mistral 7B OpenOrca에서 가장 높으며, 이 모델은 빈 답변을 자주 출력해 자명하게 일관성을 유지합니다.
  • HaluEval 결과는 QA, Dialogue, Summarisation 전반에 걸쳐 Mistral 및 LLaMA 2 계열을 선호합니다.

왜 이것이 중요한가

표준화된 오픈소스 평가 플랫폼을 제공함으로써 Hallucinations Leaderboard는 대리 점수가 아닌 구체적인 환각 지표로 모델을 비교할 수 있게 합니다. 이러한 투명성은 개발자가 잘못된 정보를 퍼뜨리거나 사용자 의도에서 벗어날 가능성이 적은 모델을 선택하도록 돕고, 커뮤니티가 향후 LLM 출시에서 사실성과 충실도를 개선하도록 장려합니다.

참여 방법

리더보드는 개방형입니다: 연구자는 새로운 모델을 제출하거나 추가 작업을 제안하거나, 리더보드 UI에 연결된 토론 페이지를 통해 계산 자원을 제공할 수 있습니다. 샘플 생성 및 상세 분석은 향후 몇 주 안에 확대될 예정입니다.

인용

리더보드 또는 데이터를 사용할 경우, 동봉된 arXiv 논문을 인용하십시오:

@article{hallucinations-leaderboard,
  author = {Giwon Hong and Aryo Pradipta Gema and Rohit Saxena and Xiaotang Du and Ping Nie and Yu Zhao and Laura Perez‑Beltrachini and Max Ryabinin and Xuanli He and Clémentine Fourrier and Pasquale Minervini},
  title = {The Hallucinations Leaderboard - An Open Effort to Measure Hallucinations in Large Language Models},
  journal = {CoRR},
  volume = {abs/2404.05904},
  year = {2024},
  url = {https://doi.org/10.48550/arXiv.2404.05904},
  doi = {10.48550/ARXIV.2404.05904}
}

Sources