OpenAI 研究:语言模型为何产生幻觉
幻觉由评估激励驱动
语言模型产生幻觉是因为当前的评估方法更倾向于奖励猜测而非对不确定性的诚实。当模型主要依据准确率——即正确回答的问题比例——进行评分时,即使缺乏必要信息,它们也会被激励去猜测,因为一次正确的猜测会提升分数,而承认不确定性(选择不回答)则必然得零分。
OpenAI 的研究表明,错误的危害大于不作答。根据 OpenAI Model Spec,模型表明不确定性或请求澄清要比提供自信但错误的信息更可取。然而,由于仅以准确率为主的排行榜主导了模型卡片和排行榜,开发者被激励构建会猜测而非保持克制的模型。
准确率与幻觉率的比较
对 gpt-5-thinking-mini 与 OpenAI o4-mini 的比较展示了策略性猜测与可靠性之间的权衡:
| 指标 | gpt-5-thinking-mini | OpenAI o4-mini |
|---|---|---|
| Abstention rate (no answer given) | 52% | 1% |
| Accuracy rate (right answer) | 22% | 24% |
| Error rate (wrong answer) | 26% | 75% |
虽然 OpenAI o4-mini 的准确率略高,但其错误率(幻觉率)显著更高,因为它几乎不选择不作答。
幻觉在下一个词预测中的根源
事实不准确源于预训练的统计特性。在预训练期间,模型通过预测海量文本中的下一个词进行学习,而没有“真/假”标签。虽然诸如拼写和括号等一致性模式容易被学习,并且这些方面的错误会随规模增大而消失,但任意的低频事实(例如某个人的生日)仅凭模式无法预测。
由于模型仅看到流畅语言的正例并必须近似整体分布,它们在没有标记为无效的示例时难以区分有效陈述与无效陈述。这一统计机制导致模型在尝试预测其无法可靠确定的低频事实时产生幻觉。
修正评估框架
为降低幻觉,OpenAI 提议更新广泛使用的基于准确率的评估,以抑制猜测。这包括:
- 对自信错误的惩罚 要比对不确定性更严厉。
- 对恰当表达不确定性的情况给予部分分数。
OpenAI 断言,仅添加少量考虑不确定性的测试不足以解决问题;必须重新设计主要的评分榜,以奖励谦逊并抑制盲目猜测,从而推动幻觉降低技术的广泛采用。
纠正常见的幻觉误解
OpenAI 的研究阐明了关于 AI 幻觉本质的若干关键点:
- 关于准确率: 准确率永远不可能达到 100%,因为某些现实问题本质上无法回答,无论模型规模或推理能力如何。
- 关于必然性: 幻觉并非不可避免,因为模型可以设计为在不确定时选择不作答。
- 关于模型规模: 避免幻觉并不一定需要更大模型的智能;小模型更容易了解自身的局限(例如,对特定语言一无所知的小模型可以直接不作答)。
- 关于问题本质: 幻觉并非“神秘的故障”,而是源于已知的统计机制和评估中的奖励结构。
- 关于衡量: 仅仅创建一个“幻觉评估”还不够;所有主要评估指标都必须更新,以奖励不确定性的表达。
Sources
- OriginalWhy language models hallucinate