Gemini Deep Think 实现跨数学、物理和计算机科学的自主研究

TL;DR

Gemini Deep Think 是 DeepMind 的高级推理模式,现已为能够处理数学、物理和计算机科学研究级别问题的自主和协作代理提供动力,产出可发表的成果并解决未解猜想。


Gemini Deep Think 概述

Gemini Deep Think 是 Gemini 基础模型的专用模式,能够实现深度、多步骤推理。在 2025 年国际数学奥林匹克和国际大学生程序设计竞赛中获得金牌后,该模型已在纯数学、理论物理和计算机科学的专业研究工作流中部署。


数学研究代理:Aletheia

关键能力: Aletheia 是基于 Gemini Deep Think 构建的数学研究代理,能够迭代生成、验证并修订解答。

  • 自然语言验证器 – 检测候选证明中的逻辑缺陷,并可请求小幅修正、重大修订或完整重新生成。
  • 失败承认 – 代理可以明确说明其无法解决某个问题,从而避免计算资源浪费。
  • 网络增强搜索 – 实时 Google Search 与浏览检索最新文献,避免虚假引用和计算错误。

"验证器充当决策点,拥有三条反馈回路:正确 → 最终输出;小幅修正 → 修订者;严重错误 → 生成器重新启动。" – DeepMind 博客说明。

性能基准

  • 在 IMO‑ProofBench Advanced 测试中,随着推理时计算规模的扩大,得分最高可达 90 %
  • 内部 FutureMath Basic 基准显示,同一扩展规律同样适用于博士水平的练习。
  • 与早期 Gemini 版本相比,在更低的推理计算下实现了更高的推理质量。

研究贡献

贡献 AI 参与度 结果
Eigenweights (Feng26) 完全自主 在算术几何中计算出新的结构常数,未使用人工输入
Independent‑set bounds (LeeSeo26) 人机协作 对相互作用粒子系统的新界限的证明
Erdős‑1051 (BKKKZ26) 人机协作 自主解答导致的推广已在同行评审论文中发表
Semi‑autonomous evaluation (Feng et al., 2026b) 混合 评估了 Bloom 的 Erdős 猜想数据库中的 700 个开放问题;解决了其中四个未解问题
Intermediate propositions (FYZ26, ACGKMP26) 混合 为两篇独立论文贡献了关键引理

DeepMind 提出了一套 AI 辅助数学的分类法:

  • Level 0 – 完全自主的结果(例如 Erdős‑652、654、1040)。
  • Level 1 – 对开放问题的自主解答(例如 Erdős‑1051)。
  • Level 2 – 已提交至期刊的人机协作或混合贡献(例如 Eigenweights、Independence Polynomials)。
  • Levels 3‑4 – 重大进展或里程碑式突破——目前为空。

所有提示和模型输出均可在 Aletheia GitHub repository 公共获取。


扩展至物理和计算机科学

第二篇论文 (arXiv:2602.03837) 将相同的代理推理应用于理论物理和计算机科学。

新的协作方案

  • Advisor 模型 – 人类通过迭代的 “Vibe‑Proving” 循环引导 AI,在直觉与形式化证明之间交替。
  • 平衡提示 – 同时请求证明 反驳,以减轻确认偏误。
  • 代码辅助验证 – AI 生成测试代码,自动验证数学主张。

突出案例研究

  1. 算法谜题 – Gemini 通过引入连续数学工具(Kirszbraun 定理、Stone‑Weierstrass 定理)解决了经典的 Max‑CutSteiner Tree 问题。
  2. 在线子模优化猜想 – 提供了一个三项反例,推翻了关于数据流中项目复制的十年直觉。
  3. 机器学习优化惩罚 – 分析了一种新颖的自适应惩罚技术,并形式化证明其收敛性。
  4. 拍卖理论扩展 – 使用拓扑学和序理论将 Revelation Principle 从有理出价扩展到实数出价。
  5. 宇宙弦辐射 – 通过 Gegenbauer 多项式推导出奇异积分的闭式解。

这些成果已在会议上展示(例如 ICLR ’26 接收),并计划提交期刊。该工作展示了 AI 跨越不同科学领域并充当高级协作者的能力。


对科学工作流的影响

  • 力量倍增器 – Gemini Deep Think 负责知识检索、严格验证和低层次的证明检查,使研究者能够专注于概念创新。
  • 负责任的文档 – 该分类法和 “Human‑AI Interaction card” 为透明报告 AI 贡献提供框架。
  • 可扩展的协作 – 代理流水线(生成器 → 验证器 → 修订者)支持完全自主研究以及引导式人机合作。

DeepMind 将 Gemini Deep Think 定位为在纯数学探索、IMO 银牌解题以及 AlphaEvolve 编码代理等早期里程碑之后的下一步进化。


参考文献


致谢

该项目在 Google DeepMind 内部进行大规模合作,由 Thang Luong 与 Vahab Mirrokni 领衔,Tony Feng、David Woodruff 等人提供技术贡献,并得到全球数学社区的广泛反馈,包括 Terence Tao 与 Ravi Vakil 等。

Sources