Gemini Deep Think 讓自主研究遍及數學、物理與電腦科學

TL;DR

Gemini Deep Think,DeepMind 的先進推理模式,現在為自主與協作型代理人提供動力,使其能夠處理數學、物理與電腦科學領域的研究級問題,產出可發表的成果並解決未解的猜想。


Gemini Deep Think 概覽

Gemini Deep Think 是 Gemini 基礎模型的專門模式,能夠執行深度、多步驟的推理。在 2025 年國際數學奧林匹克與國際大學程式設計競賽中取得金牌表現後,該模型已被部署於純數學、理論物理與電腦科學的專業研究工作流程中。


數學研究代理人:Aletheia

核心能力: Aletheia 是基於 Gemini Deep Think 的數學研究代理人,能夠迭代產生、驗證與修正解答。

  • 自然語言驗證器 – 偵測候選證明中的邏輯缺陷,並可要求小幅修正、重大修訂或完整重新生成。
  • 失敗承認 – 代理人可明確表示無法解決問題,避免浪費計算資源。
  • 網路增強搜尋 – 即時 Google 搜尋與瀏覽取得最新文獻,避免虛假引用與計算錯誤。

"驗證器作為決策點,具備三條回饋迴路:正確 → 最終輸出;小幅修正 → 修訂者;嚴重缺陷 → 生成器重新啟動。" – DeepMind 部落格說明。

效能基準

  • 在 IMO‑ProofBench Advanced 測試中,隨著推理計算規模提升,得分最高可達 90 %
  • 內部 FutureMath Basic 基準顯示,同樣的擴展律適用於博士級練習題。
  • 與早期 Gemini 版本相比,於較低推理計算下即可達到更高的推理品質。

研究貢獻

貢獻 AI 參與程度 結果
Eigenweights (Feng26) 完全自主 在算術幾何中計算出全新結構常數,無需人工介入
Independent‑set bounds (LeeSeo26) 人機協作 證明了交互粒子系統的新界限
Erdős‑1051 (BKKKZ26) 人機協作 自主解答導致一篇經同行評審的論文發表出廣義化結果
Semi‑autonomous evaluation (Feng et al., 2026b) 混合 在 Bloom’s Erdős Conjectures 資料庫上評估 700 個開放問題,解決了四個未解問題
Intermediate propositions (FYZ26, ACGKMP26) 混合 為兩篇獨立論文貢獻關鍵引理

DeepMind 提出一套 AI 輔助數學的分類法:

  • Level 0 – 完全自主的結果(例如 Erdős‑652、654、1040)。
  • Level 1 – 對開放問題的自主解答(例如 Erdős‑1051)。
  • Level 2 – 已提交期刊的人機協作或混合貢獻(例如 Eigenweights、Independence Polynomials)。
  • Levels 3‑4 – 重大的突破或里程碑式的進展 – 目前尚無案例。

所有提示與模型輸出皆可在 Aletheia GitHub repository 公開取得。


擴展至物理與電腦科學

第二篇論文 (arXiv:2602.03837) 將相同的代理推理應用於理論物理與電腦科學。

新的協作配方

  • 指導模型 – 人類透過迭代的「Vibe‑Proving」循環引導 AI,交替使用直覺與正式證明。
  • 平衡提示 – 同時要求證明 反證,以減少確認偏誤。
  • 程式碼輔助驗證 – AI 產生測試程式碼,自動驗證數學主張的正確性。

重點案例研究

  1. 演算法謎題 – Gemini 透過連續數學工具(Kirszbraun 定理、Stone‑Weierstrass 定理)解決了經典的 Max‑CutSteiner Tree 問題。
  2. 線上次模優化猜想 – 提出一個三項反例,推翻了關於資料流中項目複製的十年直覺。
  3. 機器學習優化懲罰 – 分析一種新型自適應懲罰技術,正式證明其收斂性。
  4. 拍賣理論延伸 – 使用拓撲與序理論,將啟示原理從有理出價擴展至實值出價。
  5. 宇宙弦輻射 – 透過 Gegenbauer 多項式,導出奇異積分的閉式解。

這些成果已在會議上發表(例如 ICLR ’26 接受),並計畫提交期刊。此工作展示了 AI 能跨越不同科學領域,充當高階協作者的能力。


對科學工作流程的影響

  • 乘數效應 – Gemini Deep Think 處理知識檢索、嚴謹驗證與低層次證明檢查,讓研究者得以專注於概念創新。
  • 負責任的文件化 – 這套分類法與「Human‑AI Interaction card」提供了透明報告 AI 貢獻的框架。
  • 可擴展的協作 – 代理管線(生成器 → 驗證器 → 修訂者)支援完全自主的研究與受指導的人機合作。

DeepMind 將 Gemini Deep Think 定位為繼純數學探索、IMO 銀牌解題與 AlphaEvolve 程式碼代理之後的下一個演化階段。


參考文獻


感謝

此專案由 Google DeepMind 大規模協作完成,領導者包括 Thang Luong 與 Vahab Mirrokni,技術貢獻者有 Tony Feng、David Woodruff 等多人,並得到全球數學社群的廣泛回饋,包含 Terence Tao 與 Ravi Vakil。

Sources