共識差距:為何頂尖 LLM 在 _ - 67% 的現實世界事實查核中意見分歧

大型語言模型 (LLM) 作為客觀真理仲裁者的承諾,經常在行銷材料和基準測試排行榜中被吹捧。然而,基準測試通常依賴於可能已洩漏到訓練集中的靜態數據集,透過記憶而非推理來創造出準確性的假象。為了揭開這層面紗,Lenz Research 進行了一項研究,使用了使用者提交給事實查核平台的 1,000 個現實世界主張——這些主張是新鮮、有機的,且不存在於公開的訓練語料庫中。

結果令人警醒:在五個全球領先的頂尖 LLM 中,有 67% 的主張導致了意見分歧。 這種差距表明,當我們超越精心策劃的基準測試,進入人類主張的混亂現實時,「頂尖」模型並非統一的陣線。

意見分歧的解剖

該研究使用了一個包含四個分類的判定準則:真實 (True)大部分真實 (Mostly True)誤導 (Misleading)錯誤 (False)。透過向五個模型 (GPT-5.4, Claude Opus 4.7, Gemini 3 Pro, Gemini 3 Pro + Search, 以及 Sonar Pro) 展示相同的 1,000 個主張,研究人員識別出了幾種關鍵的分歧模式。

1. 分歧的頻率

只有 33% 的主張在所有五個模型中達成了全體一致。在剩下的 67% 中,至少有一個模型與多數意見不符,或者根本沒有形成多數意見。這在錯誤率上建立了一個數學下限:如果我們假設多數意見總是正確的,那麼至少有一個模型在 67% 的主張中是錯誤的。

2. 細微差別 vs. 實質衝突

並非所有的分歧都是平等的。研究人員區分了「細微差別」(nuance,即 1 個分類的差距,例如 True vs. Mostly True) 與「實質性」分歧 (substantive,即 2 個或更多分類的差距,例如 True vs. Misleading 或 True vs. False)。

  • 僅限細微差別: 33% 的主張。
  • 實質性或兩極化: 34% 的主張。

這意味著在超過三分之一的情況下,模型們不僅是在真理的程度上存在分歧,而是在真理本身的性質上存在分歧。

3. 「中間分類」的斷裂

最引人注目的發現之一是,模型在準則的中間部分最為掙扎。雖然評審小組經常在明確的「真實」或「錯誤」判定上達成共識,但幾乎從不在「大部分真實」或「誤導」上達成一致。

在多數模型投票為「大部分真實」的主張中,0% 達成了全體一致。同樣地,只有 5% 的「誤導」多數意見是全體一致的。這表明,不同模型架構對於細微差別的邊界解釋存在巨大差異。

模型特定行為

研究揭示了不同模型在分配判定時展現出的獨特「個性」:

  • 兩極化: Gemini 3 Pro 傾向於將其判定集中在兩極 (True/False),很少分配給中間分類。
  • 分佈: Claude Opus 4.7 和 Sonar Pro 較有可能使用「大部分真實」和「誤導」類別。
  • 同儕一致性: 最高的一致性出現在 Gemini 3 Pro 及其搜尋增強版本之間 (75%),而最低的一致性出現在 Claude Opus 4.7 與 Gemini 3 Pro 之間 (53%)。

關鍵反對觀點與局限性

雖然數據指向了缺乏一致性,但社群的回應——特別是來自 Hacker News 的技術觀察者——強調了幾個方法論上的疑慮,這些個體提供了必要的背景資訊。

「強迫選擇」的謬誤

主要的批評之一是缺乏「棄權」或「未知」的選項。在現實世界的事實查核中,最誠實的答案往往是「我不知道」。透過強迫在四個分類中做出選擇,該研究可能是在衡量模型對於虛構判定(幻覺)的傾向,而非其事實知識。

"The only correct answer to that, if you don't have a search tool, and that wasn't an option." — @simonw

準則的模糊性

批評者認為,分歧可能源於提示詞 (prompt) 缺乏詳細的判定準則。在沒有明確定義什麼構成「大部分真實」與「誤導」的情況下,模型只能依賴其內部、分歧的解釋來理解這些術語。

「事實」的本質

語料庫中的某些主張可能從根本上是無法證明的,或是具有解釋性的。例如,涉及歷史邊界 (例如,某個城市在 1934 年是否位於特定州) 或對未來的預測 (例如,AI 驅動的失業問題) 的主張,並非二元事實,而是涉及框架與觀點的問題。

結論:單一「神諭」的風險

Lenz Research 研究的主要啟示是:警告不要將任何單一 LLM 視為真理的決定性神諭。當地球上最強大的五個模型無法在三分之二的現實世界主張上達成共識時,於關鍵驗證任務中依賴單一模型具有極高的風險。

正如研究所示,未來的路徑可能不在於尋找單一一個「完美」的模型,而是實施集體機器智能——建立系統,利用多個模型、交叉比對它們的分歧,並為人類提供進行最終判斷所需的證據。

Sources