AI 推理與思考的幻象:大型推理模型是否因錯誤的原因而正確?

AI 推理的悖論:高表現 vs. 低忠實度

大型推理模型(LRM)目前正產生挑戰數學研究疆界的成果,包括解決未解的研究問題以及在國際數學奧林匹克中贏得金牌。然而,越來越多的證據顯示,模型的最終答案與它們為達成答案所產生的「思考鏈」(CoT)之間存在根本性的斷層。當前 AI 研究的核心張力在於,這些模型是進行真正的邏輯推理,還是僅僅「因錯誤的原因而正確」?

「思考幻象」:不忠實的推理痕跡

雖然 LRM 會被訓練以產生中間步驟(推理痕跡)來提升準確度,研究卻指出這些痕跡往往並非模型內部計算的忠實呈現。

非因果思考標記

來自東北大學與加州大學伯克利分校的研究發現,前沿開源 LRM 中 30% 至 60% 的思考步驟對最終答案的因果影響極小。在許多情況下,移除大量此類步驟並未降低效能。

無意義填充與「喃喃自語」

研究顯示,推理痕跡的語言內容大多與實際推理無關:

  • 填充標記(Filler Tokens): 紐約大學的研究指出,一串點(無意義的填充標記)可以有效地取代可供人類閱讀的思考鏈。
  • 痕跡替換(Trace Replacement): Subbarao Kambhampati 的實驗室顯示,將正確的推理痕跡換成錯誤或無關的痕跡,未必會降低在正式推理任務上的表現。
  • 忠實度缺口(Faithfulness Gap): 即使模型僅以正確的痕跡資料進行訓練,當最終解答正確時,它們仍偶爾會產生不符合實際的推理記錄。

理論框架:近似檢索 vs. 真正推理

為了解釋模型如何在缺乏忠實推理的情況下仍能保持高準確度,研究者提出了多種相互競爭的假說。

近似檢索假說

Subbarao Kambhampati 認為 LRM 並未執行逐步的邏輯推理。相反,它們執行「近似檢索」——介於模式匹配與推理之間的過程。在此觀點下,「思考標記」充當載入模型上下文窗口的機制,使模型更有可能從訓練語料庫中預測出「類推理」的文字串。這類似於自言自語以喚起記憶,而非執行正式的演算法。

模擬遞迴假說

某些技術觀點認為,由於 Transformer 具備固定深度且缺乏原生遞迴功能,推理痕跡可用來模擬更深層的遞迴。透過產生標記,模型能在比網路層數允許的更長序列中細化概念,實質上利用 KV 快取在多次迭代的細化過程中維持狀態。

可驗證領域的優勢

LRM 在程式碼與數學領域的成功歸因於這些「可驗證領域」的特性。程式碼與證明只有二元結果(能執行或不能執行),因此提供了強大的訓練訊號。模型可能並未學習一般的推理演算法,而是吸收了足夠多正確步驟的範例,使其能預測性地模仿這些步驟,直至得到可驗證的結果。

產業觀點與「願望式記憶」問題

在學術懷疑者與產業實務者之間,對於這些結果的解讀存在明顯的分歧。

產業觀點

實務者(例如 OpenAI 的研究人員)主張模型的實用性勝過對機械性解釋的需求。他們認為,只要模型能解決複雜的數學證明,即屬於推理,無論其中間標記是否完全忠實。有些人認為早期對 AI 推理的批評是基於已過時的模型,而較新的版本(例如 GPT-5.5)已克服這些問題。

「願望式記憶」批評

批評者指出,使用「推理」、「思考」與「理解」等詞彙是「願望式記憶」——一種先入為主的標籤,假設模型具備其欲證明的能力。此種擬人化會使研究者誤以為模型正在執行認知過程,僅因其輸出看似人類對該過程的描述。

社群洞見綜合

技術觀察者之間的討論突顯了多項關鍵的反面觀點與類比:

  • 「聰明漢斯」類比: 有人將 LRM 與聰明漢斯(Clever Hans)相提並論——那匹看似會算數的馬實際上是讀取騎手的暗示。在此情境下,LRM 可能在優化人類評估者的「獎勵訊號」而非問題的邏輯真相。
  • 語意爭論: 有人認為「真實推理」與「近似檢索」的區別僅是語意問題。若系統能持續對複雜問題產生正確結果,內部機制(無論是矩陣乘法或邏輯演繹)皆次於其功能性。
  • X 光類比: 警示若在未了解內部機制的情況下使用「魔法」技術,就如早期使用 X 光:表面上運作良好,直到隱藏的損傷(或失效模式)顯現。

Sources