Gemini Deep Think 讓自主研究遍及數學、物理與電腦科學
TL;DR
Gemini Deep Think,DeepMind 的先進推理模式,現在為自主與協作型代理人提供動力,使其能夠處理數學、物理與電腦科學領域的研究級問題,產出可發表的成果並解決未解的猜想。
Gemini Deep Think 概覽
Gemini Deep Think 是 Gemini 基礎模型的專門模式,能夠執行深度、多步驟的推理。在 2025 年國際數學奧林匹克與國際大學程式設計競賽中取得金牌表現後,該模型已被部署於純數學、理論物理與電腦科學的專業研究工作流程中。
數學研究代理人:Aletheia
核心能力: Aletheia 是基於 Gemini Deep Think 的數學研究代理人,能夠迭代產生、驗證與修正解答。
- 自然語言驗證器 – 偵測候選證明中的邏輯缺陷,並可要求小幅修正、重大修訂或完整重新生成。
- 失敗承認 – 代理人可明確表示無法解決問題,避免浪費計算資源。
- 網路增強搜尋 – 即時 Google 搜尋與瀏覽取得最新文獻,避免虛假引用與計算錯誤。
"驗證器作為決策點,具備三條回饋迴路:正確 → 最終輸出;小幅修正 → 修訂者;嚴重缺陷 → 生成器重新啟動。" – DeepMind 部落格說明。
效能基準
- 在 IMO‑ProofBench Advanced 測試中,隨著推理計算規模提升,得分最高可達 90 %。
- 內部 FutureMath Basic 基準顯示,同樣的擴展律適用於博士級練習題。
- 與早期 Gemini 版本相比,於較低推理計算下即可達到更高的推理品質。
研究貢獻
| 貢獻 | AI 參與程度 | 結果 |
|---|---|---|
| Eigenweights (Feng26) | 完全自主 | 在算術幾何中計算出全新結構常數,無需人工介入 |
| Independent‑set bounds (LeeSeo26) | 人機協作 | 證明了交互粒子系統的新界限 |
| Erdős‑1051 (BKKKZ26) | 人機協作 | 自主解答導致一篇經同行評審的論文發表出廣義化結果 |
| Semi‑autonomous evaluation (Feng et al., 2026b) | 混合 | 在 Bloom’s Erdős Conjectures 資料庫上評估 700 個開放問題,解決了四個未解問題 |
| Intermediate propositions (FYZ26, ACGKMP26) | 混合 | 為兩篇獨立論文貢獻關鍵引理 |
DeepMind 提出一套 AI 輔助數學的分類法:
- Level 0 – 完全自主的結果(例如 Erdős‑652、654、1040)。
- Level 1 – 對開放問題的自主解答(例如 Erdős‑1051)。
- Level 2 – 已提交期刊的人機協作或混合貢獻(例如 Eigenweights、Independence Polynomials)。
- Levels 3‑4 – 重大的突破或里程碑式的進展 – 目前尚無案例。
所有提示與模型輸出皆可在 Aletheia GitHub repository 公開取得。
擴展至物理與電腦科學
第二篇論文 (arXiv:2602.03837) 將相同的代理推理應用於理論物理與電腦科學。
新的協作配方
- 指導模型 – 人類透過迭代的「Vibe‑Proving」循環引導 AI,交替使用直覺與正式證明。
- 平衡提示 – 同時要求證明 與 反證,以減少確認偏誤。
- 程式碼輔助驗證 – AI 產生測試程式碼,自動驗證數學主張的正確性。
重點案例研究
- 演算法謎題 – Gemini 透過連續數學工具(Kirszbraun 定理、Stone‑Weierstrass 定理)解決了經典的 Max‑Cut 與 Steiner Tree 問題。
- 線上次模優化猜想 – 提出一個三項反例,推翻了關於資料流中項目複製的十年直覺。
- 機器學習優化懲罰 – 分析一種新型自適應懲罰技術,正式證明其收斂性。
- 拍賣理論延伸 – 使用拓撲與序理論,將啟示原理從有理出價擴展至實值出價。
- 宇宙弦輻射 – 透過 Gegenbauer 多項式,導出奇異積分的閉式解。
這些成果已在會議上發表(例如 ICLR ’26 接受),並計畫提交期刊。此工作展示了 AI 能跨越不同科學領域,充當高階協作者的能力。
對科學工作流程的影響
- 乘數效應 – Gemini Deep Think 處理知識檢索、嚴謹驗證與低層次證明檢查,讓研究者得以專注於概念創新。
- 負責任的文件化 – 這套分類法與「Human‑AI Interaction card」提供了透明報告 AI 貢獻的框架。
- 可擴展的協作 – 代理管線(生成器 → 驗證器 → 修訂者)支援完全自主的研究與受指導的人機合作。
DeepMind 將 Gemini Deep Think 定位為繼純數學探索、IMO 銀牌解題與 AlphaEvolve 程式碼代理之後的下一個演化階段。
參考文獻
- Gemini Deep Think 論文:arXiv:2602.10177 與 arXiv:2602.03837。
- Aletheia 提示與輸出:https://github.com/google-deepmind/superhuman/tree/main/aletheia。
- 相關 DeepMind 部落格文章:Exploring the Beauty of Pure Mathematics、FunSearch、AlphaEvolve、Gemini for STOC’26。
感謝
此專案由 Google DeepMind 大規模協作完成,領導者包括 Thang Luong 與 Vahab Mirrokni,技術貢獻者有 Tony Feng、David Woodruff 等多人,並得到全球數學社群的廣泛回饋,包含 Terence Tao 與 Ravi Vakil。