Richard Sutton on AI Creativity and Discovery

AI 研究員 Richard Sutton 指出,雖然生成式 AI 是一種具有變革性的模仿技術,但它從根本上無法實現真正的創造力與科學發現。根據 Sutton 的觀點,監督式學習的核心限制在於它所產出的結果,要麼是新穎的,要麼是優秀的,但無法同時兼具兩者。

The Paradox of Novelty and Goodness in Generative AI

生成式 AI 系統,包括大型語言模型 (LLMs) 和圖像生成器,其設計初衷是模仿其訓練數據中的模式。Sutton 解釋說,當這些系統產生「優秀」的內容時,是因為它們成功地利用了高品質的來源材料。而當它們產生「新穎」的內容時,通常是隨機 (stochastic) 過程的結果。

在大多數實際應用中,這種權衡是一種特性而非錯誤。例如,當使用者要求對文件進行摘要時,新穎性是不可取的;任何超出原始材料的內容都會被歸類為「幻覺」。然而,對於科學與數學領域而言,這種限制至關重要。在這些領域中,進步需要同時具備新穎性與正確性(優秀)的輸出。

The Three-Step Mechanism of Discovery

Sutton 主張,真正的發現並非模式識別或預測的產物,而是一個由三個必要步驟組成的「發現」過程:

  1. Variation: 生成各種潛在的解決方案或軌跡(這可以部分基於資訊,部分是盲目的)。
  2. Evaluation: 針對明確的目標或目標進行測試,以查看哪些方案可行。
  3. Selective Retention: 保留成功的變異,並捨棄失敗的嘗試。

Sutton 指出,這個循環是科學方法、自然選擇下的生物演化,以及心理學中操作制約 (operant conditioning) 的基礎。他明確指出,標準的監督式學習、反向傳播 (backpropagation) 和梯度下降 (gradient descent) 中缺乏這種機制,因為這些系統缺乏在執行期間進行評估的步驟,以判斷它們所產生的新穎性。

Distinguishing Mimicking AI from Discovering AI

Sutton 將「普通型」生成式 AI 與具備真正發現能力的系統區分開來。他舉出了幾個透過引入評估機制而超越簡單模仿的 AI 範例:

  • AlphaGo and AlphaZero: 這些系統使用了自我對弈與明確的勝負目標,來發現原創性的策略(例如 AlphaGo 的「第 37 手」)。
  • AlphaFold and AlphaProof: 這些系統對科學與數學領域做出了實質性的進展。
  • Claude-Code: 被引用為在程式設計領域帶來真正進展的系統。

當人類使用生成式 AI 產生多張圖像,然後選擇最佳的一張時,「人類+AI 系統」完成了發現的過程,由人類提供了缺失的評估步驟。

Technical Refinements: Continual Backpropagation

為了應對深度學習的局限性,Sutton 提到標準的反向傳播依賴於隨機初始化來產生變異,但這種變異僅在開始時發生一次。為了維持隨時學習與發現的能力,Sutton 的研究團隊引入了「持續反向傳播 (continual backpropagation)」,透過定期將較少使用的神經元重新初始化為隨機權重,使塑性與變異得以持續存在。

Community Perspectives and Counterpoints

圍繞著 Sutton 的觀點的討論,突顯了目前 AI 技術的幾個技術細節差異:

"The most successful applications like coding are not the result of pure LLM/generative modeling. They come from closing the loop with an agentic harness. The generate-test-selectively refine loop is the core modality of scientific work."

批評者與評論家指出,Sutton 所做的區分,主要是在原始預訓練模型與「代理型 (agentic)」系統之間。有些人認為,訓練後處理 (post-training) 與強化學習 (RLHF) 已經包含了他在描述中提到的變異、評估與選擇性保留循環。其他人則指出,組合泛化 (compositional generalization)——即模型重新組合已知抽象概念的方式——即使在沒有正式的發現循環時,也可能構成一種有意義的新穎性。

最終,Sutton 的「號召行動」是呼籲 AI 社群應朝著完全自動化創造力與發現的過程邁進,透過與 AI 系統共享明確的目標,讓它們能夠評估自己的輸出,並自主地參與科學進步。

Sources