Hugging Face 幻覺排行榜發布與初步發現

TL;DR

Hugging Face 幻覺排行榜的推出旨在於一系列開源資料集上對大型語言模型的事實性與忠實性幻覺進行基準測試,提供透明且持續更新的排名,協助研究人員找出最可靠的模型。

排行榜衡量的內容

排行榜使用 EleutherAI LM Evaluation Harness 來評估模型在 與幻覺相關的基準測試 上的表現。所有指標皆正規化至 ([0,1]) 範圍,分數越高代表幻覺越少。評估在位於愛丁堡國際資料設施的 NVIDIA A100 GPU 以及愛丁堡大學內部叢集上執行。

基準測試套件

排行榜彙總了八個任務族群,每個族群針對特定的幻覺失效模式:

  • 封閉書本開放領域問答 – NQ Open、TriviaQA、TruthfulQA(8‑shot 與 64‑shot 設定)。準確度以 Exact Match 計算。
  • 摘要 – XSum 與 CNN/DM(2‑shot)。指標:ROUGE‑1/2/L、factKB 與 BERTScore‑Precision。
  • 閱讀理解 – RACE(2‑shot)與 SQuADv2(4‑shot)。評估答案選擇與無法回答問題的偵測。
  • 指令遵循 – MemoTrap(零-shot)與 IFEval(零-shot)。測試模型是否在不記憶不當文字的情況下遵守限制。
  • 事實查核 – FEVER(16‑shot)。模型預測 SUPPORTS、REFUTES 或 NOT ENOUGH INFO。
  • 幻覺偵測 – FaithDial、True‑False、HaluEval(問答/對話/摘要)於 8‑shot 設定。模型必須標記出幻覺輸出。
  • 自我一致性 – SelfCheckGPT(238 個實例)。每個實例產生六段文字(一次決定性、五次隨機),並使用 NLI 模型標記不一致的句子。

初步發現

模型群聚

對結果矩陣進行階層式聚類,顯示出三個自然的群組:

  1. 基於 Mistral 7B 的模型(例如 Mistral 7B‑OpenOrca、Zephyr 7B beta、Starling‑LM 7B alpha)。
  2. 基於 LLaMA 2 的模型(例如 LLaMA 2 7B、LLaMA 2 13B、Wizard Vicuna 13B)。
  3. 較小的模型(例如 BLOOM 560M、GPT‑Neo 125M、Orca Mini 3B)。

封閉書本問答

  • Mistral 7B 變體在 TriviaQA(8‑shot)與 TruthfulQA 上的表現優於其他模型。
  • Falcon 7B 在 NQ Open(8‑shot)上領先。將 shot 數提升至 64‑shot 後,LLaMA 2 13B 的表現提升至最高(EM = 0.34)。

指令遵循

  • 令人驚訝的是,BLOOM 560M 在 MemoTrap 上名列前茅,暗示較小的模型較少記憶名言。
  • LLaMA 2 13B Chat 與 Mistral 7B Instruct 在較複雜的 IFEval 任務上取得最高分。

摘要

  • GPT‑JT 6B 在 CNN/DM 上取得最高的 ROUGE 分數,主要是透過抽取前導句子。
  • LLaMA 2 13B 表現不佳,常在單一 token 後即截斷輸出,可能是受限於上下文長度。

閱讀理解

  • Mistral 7B 與 LLaMA 2 系列在 RACE 上領先。
  • 在 SQuADv2 中,mGPT 擅長偵測無法回答的問題,而 Starling‑LM 7B alpha 在回答可回答的問題上表現最佳。

幻覺偵測

  • SelfCheckGPT 的分數在 Mistral 7B OpenOrca 上最高,該模型常輸出空答案,因而在自我一致性上顯得簡單。
  • HaluEval 的結果在問答、對話與摘要三項任務上皆偏好 Mistral 與 LLaMA 2 系列。

為何這很重要

透過提供 標準化、開源的評估平台,幻覺排行榜使得能以具體的幻覺指標而非代理分數來比較模型成為可能。此透明度協助開發者挑選較不會散布錯誤資訊或偏離使用者意圖的模型,並激勵社群在未來的 LLM 版本中提升事實性與忠實性。

參與方式

排行榜採開放式設計:研究者可提交新模型、提議額外任務,或透過排行榜 UI 上連結的討論頁面貢獻計算資源。範例產出與詳細分析將於未來幾週持續擴充。

引用

若使用排行榜或其資料,請引用隨附的 arXiv 論文:

@article{hallucinations-leaderboard,
  author = {Giwon Hong and Aryo Pradipta Gema and Rohit Saxena and Xiaotang Du and Ping Nie and Yu Zhao and Laura Perez‑Beltrachini and Max Ryabinin and Xuanli He and Clémentine Fourrier and Pasquale Minervini},
  title = {The Hallucinations Leaderboard - An Open Effort to Measure Hallucinations in Large Language Models},
  journal = {CoRR},
  volume = {abs/2404.05904},
  year = {2024},
  url = {https://doi.org/10.48550/arXiv.2404.05904},
  doi = {10.48550/ARXIV.2404.05904}
}

Sources