Hugging Face 幻觉排行榜发布及初步发现
TL;DR
Hugging Face 幻觉排行榜已上线,用于在一套开源数据集上对大型语言模型的事实性和忠实性幻觉进行基准测试,提供透明、持续更新的排名,帮助研究者识别最可靠的模型。
排行榜衡量的内容
排行榜使用 EleutherAI LM Evaluation Harness 对模型进行 与幻觉相关的基准 评估。所有指标均归一化到 ([0,1]) 区间,分数越高表示幻觉越少。评估在爱丁堡国际数据设施的 NVIDIA A100 GPU 以及爱丁堡大学内部集群上运行。
基准套件
排行榜汇总了八类任务,每类针对一种特定的幻觉失效模式:
- 闭卷开放域问答 – NQ Open、TriviaQA、TruthfulQA(8‑shot 与 64‑shot 设置)。准确率通过 Exact Match 计算。
- 摘要 – XSum 与 CNN/DM(2‑shot)。指标:ROUGE‑1/2/L、factKB 与 BERTScore‑Precision。
- 阅读理解 – RACE(2‑shot)和 SQuADv2(4‑shot)。评估答案选择和不可回答问题检测。
- 指令遵循 – MemoTrap(zero‑shot)和 IFEval(zero‑shot)。测试模型在不记忆不期望文本的前提下是否遵守约束。
- 事实核查 – FEVER(16‑shot)。模型需预测 SUPPORTS、REFUTES 或 NOT ENOUGH INFO。
- 幻觉检测 – FaithDial、True‑False、HaluEval(问答/对话/摘要)在 8‑shot 设置下。模型必须标记出幻觉输出。
- 自洽性 – SelfCheckGPT(238 条实例)。每个实例生成六段文本(一个确定性,五个随机),并使用 NLI 模型标记不一致的句子。
初步发现
模型聚类
对结果矩阵进行层次聚类,揭示出三个自然分组:
- 基于 Mistral 7B 的模型(例如 Mistral 7B‑OpenOrca、Zephyr 7B beta、Starling‑LM 7B alpha)。
- 基于 LLaMA 2 的模型(例如 LLaMA 2 7B、LLaMA 2 13B、Wizard Vicuna 13B)。
- 较小模型(例如 BLOOM 560M、GPT‑Neo 125M、Orca Mini 3B)。
闭卷问答
- Mistral 7B 系列在 TriviaQA(8‑shot)和 TruthfulQA 上优于其他模型。
- Falcon 7B 在 NQ Open(8‑shot)上领先。将 shot 数提升至 64‑shot 可使 LLaMA 2 13B 达到最高(EM = 0.34)。
指令遵循
- 令人惊讶的是,BLOOM 560M 在 MemoTrap 上名列前茅,表明较小模型更少记忆名言。
- LLaMA 2 13B Chat 与 Mistral 7B Instruct 在更复杂的 IFEval 任务上取得最高分。
摘要
- GPT‑JT 6B 在 CNN/DM 上获得最高 ROUGE 分数,主要通过提取首句实现。
- LLaMA 2 13B 表现不佳,常在生成单个 token 后截断,可能受限于上下文长度。
阅读理解
- Mistral 7B 与 LLaMA 2 系列在 RACE 上领先。
- 在 SQuADv2 中,mGPT 在检测不可回答问题上表现突出,而 Starling‑LM 7B alpha 在回答可回答问题上最佳。
幻觉检测
- SelfCheckGPT 的最高分出现在 Mistral 7B OpenOrca 上,该模型经常输出空答案,因而在自洽性上 trivially 一致。
- HaluEval 结果显示,Mistral 与 LLaMA 2 系列在问答、对话和摘要任务中均占优势。
为什么重要
通过提供 标准化、开源的评估平台,幻觉排行榜使得能够基于具体的幻觉指标而非代理分数比较模型。这种透明性帮助开发者挑选更不易传播错误信息或偏离用户意图的模型,并激励社区在未来的 LLM 发行版中提升事实性和忠实性。
参与方式
排行榜是开放式的:研究者可以提交新模型、提议额外任务,或通过排行榜 UI 上的讨论页面贡献计算资源。示例生成和详细分析将在未来几周内进一步扩展。
引用
如果使用排行榜或其数据,请引用相应的 arXiv 论文:
@article{hallucinations-leaderboard,
author = {Giwon Hong and Aryo Pradipta Gema and Rohit Saxena and Xiaotang Du and Ping Nie and Yu Zhao and Laura Perez‑Beltrachini and Max Ryabinin and Xuanli He and Clémentine Fourrier and Pasquale Minervini},
title = {The Hallucinations Leaderboard - An Open Effort to Measure Hallucinations in Large Language Models},
journal = {CoRR},
volume = {abs/2404.05904},
year = {2024},
url = {https://doi.org/10.48550/arXiv.2404.05904},
doi = {10.48550/ARXIV.2404.05904}
}