LLMs Can't Jump: Analyzing the Limits of AI Scientific Discovery
The Core Thesis: LLMs Lack the Capacity for Foundational "Jumps"
ポジションペーパー「LLMs Can't Jump」において、著者である Tom Zahavy は、大規模言語モデル(LLM)は、新しい基礎的な公理を創造したり、重大な科学的進歩に必要とされる直感的な飛躍(jumps)を行ったりすることが構造的に不可能であると主張しています。アルベルト・アインシュタインによる一般相対性理論の定式化を主要なケーススタディとして用い、この論文は、観測データが乏しい場合に、全く新しい枠組みを発明するために必要な「アブダクション(仮説的推論)」を LLM は実行できないと断じています。
Zahavy は、アインシュタインが行った「飛躍」—具体的には等価原理—は、既存の言語データの処理の結果ではなく、感覚的な経験に基づいた物理的な直感と思考実験に根ざしたものであると示唆しています。中心的な主張は、LLM は物理的な世界との直接的な相互作用ではなく、言語(人間の経験の損失のあるエンコーディング)に基づいて訓練されているため、世界をシミュレートし、基礎的な発明に必要な内部実験を実行するために必要な接地性(grounding)を欠いているというものです。
Clarifications from the Author
論文の流通を受け、Tom Zahavy は、自身の研究の範囲と意図を明確にするために重要なコンテキストを提供しました。
- Personal Position, Not Corporate Policy: Zahavy は、この論文は個人のポジションペーパーであり、Google DeepMind の公式な見解を表すものではないことを強調しました。
- Not a "Dead End" Argument: 彼は、この論文が LLM が科学的発見を決してできないと主張することを意図したものではないことを明らかにしました。彼は、AI が驚くべき発見を継続できることの証拠として、自身が取り組んでいる AlphaProof(IMO のメダルを獲得した最初の AI システム)に言及しました。
- Focus on a Specific Capability: この論文は、AI があらゆる形態の科学的進歩が不可能であると主張するのではなく、AI が一般相対性理論の発明に似た「飛躍」を行うためには何が必要かを具体的に探求するものです。
Technical Critiques and Counter-Arguments
LLM は「飛躍」できないというテーゼは、主に以下の3つの領域に焦点を当てた技術コミュニティからの強い懐疑に直面しています。
1. Lack of Quantitative Evidence
批判者は、この論文は実証的な研究ではなく、修辞的な立場表明であると主張しています。ある著名な批判は、「LLM は飛躍できない」という主張には定量的な証拠がなく、「飛躍」を構成するものの厳密な定義が欠けていることを示唆しています。これをテストするための提案された方法としては、2025年の知識カットオフを持つ LLM を使用し、最小限の情報で2026年に発表された科学的結果を再導出しようと試みることなどが挙げられます。
2. The Role of Embodiment and Sensory Experience
論文は、発見には物理的な感覚と身体化されたシミュレーションが必要であると主張していますが、一部の専門家は、これは一般相対性理論の比喩に過剰に依存しすぎていると主張しています。例えば、量子力学におけるエネルギーの量子化は、物理的な感覚を通じて発見されたのではなく、量子化が黒体放射スペクトルの問題を解決するという数学的な気づきを通じて発見されました。これは、「飛躍」が感覚的な接地なしに抽象的な領域で起こり得ることを示唆しています。
3. The "Moving Goalpost" Phenomenon
多くの観測者は、AI の能力のベンチマークが絶えず変化していると指摘しています。LLM が既存のベンチマークを打破するにつれ、知能の定義は次の到達不可能な頂点、この場合は「直感的な飛躍」へと移されます。この視点は、現在の限界は、根本的な構造的不可能性ではなく、アーキテクチャや「ハーネス」(環境)の関数である可能性を示唆しています。
Proposed Solutions and Alternative Perspectives
「飛躍」の認識された限界を克服するために、いくつかの理論的な経路が提案されています。
World Models and Multimodal Grounding: 論文は、世界モデル(world models)が解決策であると示唆しています。しかし、批判者は、現在のマルチモーダル融合(画像/音声/ビデオの統合)が、推論能力における一般的な飛躍的進歩をまだ生み出していないことを指摘しています。
Temperature Modulation: LLM の temperature を調整すること、つまりアイデア生成には高い temperature を、批判には低い temperature を使用することで、可能性を「幻視(hallucinating)」し、その後に検証のために厳密さを適用するという人間のプロセスを模倣できるのではないかと示唆する者もいます。
Environmental Feedback Loops: LLM を物理的な世界のフィードバックループ(自動化学研究など)に統合することで、著者が欠けていると主張する接地性を提供できる可能性があります。
Architectural Changes: LLM は根本的に確率的であり、直感的な飛躍やユーモアに必要な潜在空間における「直交方向の変化」のためのメカニズムを欠いているという示唆があります。これには、「左折」を行うために特別に設計された新しいアーキテクチャ・コンポーネントが必要になるでしょう。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch