LLMs 無法躍遷:分析 AI 科學發現的局限性

核心論點:LLMs 缺乏進行基礎性「躍遷」的能力

在名為《LLMs Can't Jump》的立場論文中,作者 Tom Zahavy 主張大型語言模型(LLMs)在結構上無法創造新的基礎公理,也無法做出重大科學突破所需的直覺飛躍。該論文以愛因斯坦的廣義相對論公式作為主要案例研究,指出當觀察數據稀缺時,LLMs 無法進行發明全新框架所需的「溯因推理」(abductive reasoning)。

Zahavy 認為,愛因斯坦所做的「躍遷」——特別是等效原理——並非處理現有語言數據的結果,而是基於感官經驗的物理直覺與思想實驗。其核心主張是,由於 LLMs 是基於語言(人類經驗的有損編碼)而非與物理世界的直接互動進行訓練,因此缺乏模擬世界並進行基礎發明所需內部實驗的必要接地性(grounding)。

作者的澄清

隨著論文的傳閱,Tom Zahavy 提供了關鍵背景資訊,以澄清其研究的範圍與意圖:

  • 個人立場,而非公司政策: Zahavy 強調該論文僅為個人立場論文,並不代表 Google DeepMind 的官方觀點。
  • 並非「死胡同」論點: 他澄清該論文並非旨在主張 LLMs 永遠無法做出科學發現。他提到自己在 AlphaProof(首個獲得 IMO 金牌的 AI 系統)上的工作,以此證明 AI 可以且將繼續做出驚人的發現。
  • 專注於特定能力: 該論文特別探討 AI 若要做出類似廣義相對論發明那樣的躍遷需要具備什麼條件,而非聲稱 AI 無法進行所有形式的科學進步。

技術評論與反論

關於 LLMs 無法「躍遷」的論點遭到了技術社群的重大質疑,主要集中在三個領域:

1. 缺乏定量證據

批評者認為該論文是一種修辭性的立場,而非實證研究。其中一個突出的批評指出,「LLMs 無法躍遷」的說法缺乏定量證據的支持,且對於何謂「躍遷」缺乏嚴謹的定義。一種建議的測試方法是使用一個知識截止日期為 2025 年的 LLM,並嘗試在資訊極少的情況下,重新推導出 2026 年發表的科學結果。

2. 具身智能與感官經驗的角色

雖然論文認為物理感覺與具身模擬對於發現是必要的,但有些人認為這過度依賴廣義相對論的類比。例如,量子力學中的能量量子化並非透過物理感覺發現的,而是透過數學上的實現,發現量子化解決了黑體輻射譜問題。這表明「躍遷」可以在沒有感官接地的情況下,在抽象領域中發生。

3. 「移動目標」現象

幾位觀察家指出,AI 能力的基準點一直在移動。隨著 LLMs 摧毀了現有的基準測試,智能的定義被推向下一個無法觸及的高峰——在這種情況下,就是「直覺躍遷」。這種觀點認為,目前的局限性可能是架構或「控制裝置」(環境)的問題,而非根本性的結構性不可能。

建議的解決方案與替代觀點

為了克服感知中的「躍遷」限制,學界提出了幾條理論路徑:

  • 世界模型與多模態接地: 論文認為世界模型是解決方案。然而,批評者指出,目前的多模態融合(整合圖像/音訊/影片)尚未在推理能力上產生普遍性的階段性改變。

  • 溫度調節(Temperature Modulation): 有人建議調節 LLM 的溫度——使用高溫度進行構思,使用低溫度進行批判——可以模擬人類「幻覺」出可能性,然後應用嚴謹性來驗證它的過程。

  • 環境回饋迴路: 將 LLMs 整合到物理世界的回饋迴路中(例如在自動化化學研究中),可能提供作者所聲稱缺失的接地性。

  • 架構變革: 有人建議 LLMs 本質上是機率性的,缺乏在潛在空間(latent space)中進行「正交方向改變」的機制,而這對於直覺飛躍或幽默感是必要的。這將需要一個專門為進行「左轉」而設計的新架構組件。

Sources

相關