前沿斷裂:為何頂尖 LLM 在 67% 的現實世界事實查核中意見分歧
當我們想到「前沿」大型語言模型(LLMs)時,我們通常會想像一種趨於一致的智能——即 OpenAI、Anthropic 和 Google 的最強大模型最終會在單一、客觀的真理上達成共識。然而,Lenz Research 的新研究顯示,現實情況要破碎得多。
在一項針對用戶提交給事實查核平台的 1,000 個現實世界主張的研究中,全球五個領先的 LLM 在其中 67% 的判定結果上存在分歧。
這一發現強調了一個根本性的挑戰:當「最強」的模型都無法達成共識時,將任何單一 AI 視為真理的預言者將成為一個冒險的提議。
分歧的解剖
該研究使用了一個包含四個類別的判定準則:True、Mostly True、Misleading 和 False。透過向五個前沿模型(GPT-5.4、Claude Opus 4.7、Gemini 3 Pro、Gemini 3 Pro + Search 和 Sonar Pro)展示 1,000 個最近的、非基準測試的主張,研究人員發現了令人震驚的共識缺失。
關鍵統計發現
- 高分歧率: 在 67% 的主張中,至少有一個模型與多數意見不符,或者根本沒有形成多數意見。
- 實質性差異: 在 34% 的案例中,分歧不僅僅是細微差別的問題(例如 True vs. Mostly True),而是「實質性」的,這意味著至少有兩個模型之間相差兩個或更多個類別(例如 True vs. Misleading 或 True vs. False)。
- 「中間地帶」的斷裂: 評審小組最常在兩極趨於一致。在 328 個一致的聲明中,絕大多數是 True 或 False。幾乎沒有主張被一致評為「Mostly True」或「Misleading」,這表明中間地帶的細微差別正是 AI 可靠性的崩潰點。
模型特定行為
並非所有模型都表現相同。研究揭示了不同架構之間明顯的「決策先驗」:
- 兩極化 vs. 分佈: Gemini 3 Pro 表現出強烈的傾向,將判定結果集中在 True/False 兩極(54% True, 40% False),而 Claude Opus 4.7 和 Sonar Pro 則將其判定結果更廣泛地分佈在中間類別中。
- 檢索 vs. 參數化: 研究比較了參數化模型(僅限訓練)與檢索增強模型。有趣的是,在 Gemini 3 Pro 及其具備搜尋功能的對應版本之間發現了最高的同儕一致性(75%),而最低的一致性(53%)發生在 Claude Opus 4.7 和 Gemini 3 Pro 之間。
特定領域的摩擦
分歧並非在所有主題上都是均勻的。某些領域被證明比其他領域更具爭議性:
| Domain | Any Disagreement | Substantive Disagreement |
|---|---|---|
| Legal | 77% | 40% |
| Health | 71% | 29% |
| Politics | 70% | 38% |
| Finance | 67% | 39% |
| History | 53% | 24% |
Legal 和 Health 主張的歧異率最高,這表明專業知識以及對複雜法規或醫療數據的解讀仍是大型語言模型通用型 LLM 的重大障礙。
批判性觀點與局限性
雖然數據令人信服,但該研究在 Hacker News 的技術社群中引起了顯著的辯論,批評者指出了幾個方法論上的疑慮:
「強迫選擇」問題
最突出的批評之一是缺乏「Abstain」(棄權)或「Unknown」(未知)的選項。批評者認為,對於許多現實世界的聲明——例如對未來的預測或無法證實的哲學陳述——唯一正確的答案是「我不知道」。
"The only correct answer to that, if you don't have a search tool, is 'this claim is impossible for me to verify' and that wasn't an option."
提示詞與準則模糊性
一些觀察者指出,所使用的提示詞非常簡略:"Classify this claim as of
批評者認為,如果不定義什麼構成「Mostly True」與「Misleading」的詳細準則,模型基本上是在猜測研究人員的意圖,這使得該研究既是對模型本身的評估,也是對提示詞的評估。
人類基準線
另一個爭議點是缺乏人類基準線。如果不知道人類專家在同樣的 1,000 個主張中分歧的頻率,就很難判斷 67% 的分歧率是 AI 的失敗,還是反映了現實世界事實的內在模糊性。
結論:超越預言者
Lenz Research 的研究為在關鍵任務事實查核中的 LLM 部署提供了一個警示。前沿模型在現實世界數據上(這些數據並未透過基準測試洩露到其訓練集中)表現出如此劇烈的分歧——這表明我們遠未達到「通用真理機器」的階段。
正如一位社群成員所建議的,未來的路徑可能不是單一、全能的模型,而是「集體機器智能」,其中多個模型運作並具備聲譽與問責制,模仿人類專家辯論並完善真理的方式。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch