LLM 擅長哪種數學?——對近期 AI 驅動突破的分析
TL;DR
LLM 目前最強之處在於透過快速探索大量標準構造來生成具體的實例或反例——本質上是在解決存在性問題——而人類數學家在需要對巨大搜尋空間進行巧妙剪枝的深層、新穎證明構想方面,仍然佔據主導地位。
1. 近期的 AI 里程碑及其本質
- OpenAI 的十項突破 (2026 年 8 月) 包括一個非 sofic 群構造和多色 Ramsey 數的超指數下界。這兩項結果都是 存在性陳述:它們展示了一個特定的對象(一個群、一個圖族),用以反駁廣泛持有的猜想或改進界限。
- 早期的 AI 驅動成就——Jacobians、單位距離猜想、Vinogradov 型定理——具有相同的模式:頭條新聞是顯式的構造,而非新的概念框架。
- 本文認為,如果 LLM 是普遍優越的,我們將看到所有領域都湧現大量結果,但事實並非如此。
2. 反例 vs. 定理 – 邏輯上的細微差別
- 反例在形式上是普遍主張錯誤的 存在性 證物,但數學家將該術語保留給推翻 強烈預期 陳述的對象。
- Vinogradov 三質數定理 說明了為什麼並非每個存在性陳述都是反例:存在量詞(大整數 (N))是一個技術手段,而非發現的核心。
- Gluskin 的 Banach-Mazur 直徑結果 是真正的反例,因為它提供了距離隨維度線性縮放的顯式空間,與任何對次線性界限的期望相矛盾。
- 兩者的區別取決於 數學語境 和 預期,而不僅僅是量詞結構。
3. 為何 LLM 在尋找實例方面表現出色
- 廣博的知識庫 – LLM 可以立即檢索標準論證、經典構造和已知的對象族。
- 大規模並行搜尋 – 它們的計算速度讓它們可以嘗試數百萬個候選對象或證明草圖,並以低成本捨棄失敗案例。
- 機率採樣 – 正如評論者 @h_cap_mirin 所強調,「採樣」(生成大量候選並進行篩選)是 AlphaCode 以及近期 Claude 驅動的 Riemann-zeta 界限改進等成功的核心。
- 易於驗證 – 對於許多存在性問題,檢查一個候選對象是直接的(例如,測試圖性質、評估範數),這使得暴力搜尋變得可行。
4. 人類的優勢:剪枝搜尋樹
- 當 搜尋樹 深且分支極多,需要直覺來捨棄大量死胡同時,人類表現卓越。
- 本文列舉了三種需要此類直覺的實例生成策略:
- 元變量推理 (Metavariable reasoning) – 透過保留部分未指定部分來構造對象,隨後再進行精細化。
- 證明反面 – 推導出使否定命題更容易被反駁的引理,然後進行回溯翻譯。
- 連續逼近 – 根據診斷反饋迭代改進猜測。
- 評論者 @tel 將 LLM 描述為「合理的隨機對象」,它們模仿人類模式,但缺乏高效剪枝所需的深層 嗅覺 (nose)。
- 在 LLM 開發出相當的「嗅覺」之前,它們將依賴於大量的嘗試,而非巧妙的方向。
5. 社群意見調查 (HN 評論)
- @h_mirin 強調測試時縮放 (test-time scaling) 和採樣是 AI 數學突破的引擎,並指出證明驗證仍是一個瓶頸。
- @steinwinde 詢問 AI 研究是否僅限於解決頭條新聞問題,指出缺乏 AI 驅動的理論建設。
- @parhamn 關注驗證能力:如果 AI 產生大量證明,需要多少人類專家來檢查它們?
- @YeGoblynQueenne 敘述了 Anthropic 的 Claude 實驗(650 個想法 → 2,400 個 shell commands → 改進的 zeta-zero 界限)作為一個經典的生成並測試 (generate-and-test) 流程。
- @n4r9 引用了本文結論性的指標:新穎、驚人、優美 的證明將是人類級別 AI 數學的標誌。
- @scronkfinkle 和 @igor_nast 呼應了這一觀點,認為目前的 LLM 本質上是擁有有限創造洞察力的大型知識庫。
6. LLM 擅長處理的問題初步分類
| 問題類型 | LLM 為何成功 | 範例策略 |
|---|---|---|
| 現成實例 (測試已知族) | 直接檢索 + 快速驗證 | 字典搜尋、模式匹配 |
| 直接證明 (標準引理) | 訓練數據包含許多實例 | 重用教科書證明 |
| 機率方法 (隨機構造) | 從分佈中採樣的能力 | 隨機凸包、隨機圖 |
| 通用實例 (測度為零的論證) | 識別典型的測度論措辭 | 引用「幾乎所有 (almost every)」論證 |
| 元變量 / 迭代設計 | 需要對進度的判斷;較弱 | 目前表現有限 |
| 證明反面 | 需要洞察力來識別有用的引理;較弱 | 有時透過暴力搜尋成功 |
| 深層、新穎技術 (例如 cap-set 突破) | 需要超越訓練數據的概念飛躍;目前罕見 | 尚未觀察到 |
7. 前景與開放性問題
- 縮放 vs. 湧現 – 更大的模型會自動獲得更好的「嗅覺」,還是需要新的訓練範式?(參見評論 @scronkfinkle 關於湧現 AGI 特徵的討論。)
- 獎勵工程 – 本文建議對死胡同和「作弊」進行懲罰,這可能會推動模型朝向更像人類的探索行為發展。
- 驗證基礎設施 – 正如 @parhamn 所指出的,社群需要可擴展的證明檢查工具(Lean, Coq)來跟上 AI 生成結果的步伐。
- 定義人類級別的成功 – 根據作者和評論者的說法,基準是一個 令人驚訝、優美且難以偶然發現 的證明——這種結果能重塑一個領域。
8. 結論
- LLM 擅長 實例驅動的存在性問題,因為它們結合了百科全書式的知識與暴力採樣。
- 它們 尚不擅長深層的概念突破,這需要對巨大的搜尋空間進行複雜的剪枝。
- 未來的進步可能來自於 更大的模型、更好的獎勵信號以及與形式驗證更緊密的結合。
- 當一個 LLM 產出一個感覺 新穎、優雅且非顯而易見 的證明時(就像 cap-set 定理對人類所做的那樣),社群將會認可真正的人類級別 AI 數學。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch