OpenAI 研究:為何語言模型會產生幻覺
幻覺是由評估激勵所驅動
語言模型會產生幻覺,是因為目前的評估方法偏向獎勵猜測而非對不確定性的誠實。當模型主要以準確率——即正確回答的問題比例——來評分時,即使缺乏必要資訊,它們也會被激勵去猜測,因為正確的猜測能提升分數,而承認不確定性(選擇不回答)則會得到零分。
OpenAI 的研究指出,錯誤的影響比不回答更為嚴重。根據 OpenAI Model Spec,模型表達不確定或請求澄清比提供自信卻錯誤的資訊更為可取。然而,由於僅以準確率為主的排行榜主導了模型卡與排行榜,開發者因此傾向打造會猜測而非保留的模型。
準確率與幻覺率的比較
對 gpt-5-thinking-mini 與 OpenAI o4-mini 的比較顯示了策略性猜測與可靠性之間的取捨:
| 指標 | gpt-5-thinking-mini | OpenAI o4-mini |
|---|---|---|
| 不回答率(未給予答案) | 52% | 1% |
| 準確率(正確答案) | 22% | 24% |
| 錯誤率(錯誤答案) | 26% | 75% |
雖然 OpenAI o4-mini 的準確率略高,但其錯誤率(幻覺率)顯著較高,因為它很少不回答。
幻覺在下一詞預測中的起源
事實性不準確源於預訓練的統計特性。在預訓練期間,模型透過預測大量文本中的下一個詞彙來學習,且沒有「真/假」標籤。雖然一致的模式——例如拼寫與括號——容易被學習,且這些領域的錯誤會隨規模增大而消失,但任意的低頻事實(例如特定人物的生日)僅靠模式無法預測。
由於模型僅見到流暢語言的正向範例,且必須近似整體分佈,它們在缺乏標記為無效的範例時,難以區分有效與無效的敘述。這種統計機制導致模型在嘗試預測無法可靠判斷的低頻事實時產生幻覺。
修正評估框架
為了減少幻覺,OpenAI 提議更新廣泛使用的以準確率為基礎的評估,以抑制猜測。這包括:
- 懲罰自信的錯誤 比不確定性更嚴重。
- 提供部分分數 給予適當表達不確定性的情況。
OpenAI 主張,僅加入少量具備不確定性認知的測試仍不足;必須重新設計主要的排行榜,以獎勵謙遜並抑制盲目猜測,從而擴大幻覺減少技術的採用。
針對幻覺的常見誤解
OpenAI 的研究闡明了關於 AI 幻覺本質的幾個關鍵要點:
- 關於準確率: 準確率永遠不會達到 100%,因為某些現實世界的問題本質上無法回答,無論模型大小或推理能力如何。
- 關於必然性: 幻覺並非不可避免,因為模型可以設計成在不確定時選擇不回答。
- 關於模型大小: 避免幻覺並不僅需大型模型的智慧;小模型更容易了解自己的限制(例如,對特定語言毫無知識的小模型可以直接不回答)。
- 關於問題的本質: 幻覺不是「神祕的故障」,而是源於已被理解的統計機制與評估中的獎勵結構。
- 關於衡量: 僅僅建立一個「幻覺評估」並不足夠;所有主要的評估指標都必須更新,以獎勵表達不確定性的行為。
Sources
- OriginalWhy language models hallucinate