Gemini Deep Think 在 IMO 2025 中达到金牌标准
Gemini Deep Think 在 IMO 2025 中实现金牌表现
Gemini 的高级 Deep Think 版本已正式在 2025 年国际数学奥林匹克(IMO)中达到金牌标准,完美解答了六道题中的五道,总得分 35 分。该结果由 IMO 协调员使用与学生解答相同的评判标准进行官方评分和认证。
来自 AlphaProof 和 AlphaGeometry 的技术演进
与 2024 年的结果相比,这一成就标志着 AI 数学推理的显著飞跃。2024 年,Google DeepMind 的 AlphaProof 和 AlphaGeometry 2 系统通过解答四道题并获得 28 分,达到了银牌标准,但需要专家将题目翻译成如 Lean 等领域特定语言,并耗时两到三天的计算。
相比之下,2025 年的 Gemini Deep Think 模型全程使用自然语言操作,直接根据官方题目描述在 4.5 小时的比赛时间限制内生成严谨的数学证明。
Deep Think 推理架构
Gemini Deep Think 是一种为复杂问题设计的增强推理模式。它利用多项关键研究技术来提升解题能力:
- 并行思考:模型不再仅沿单一线性思路进行,而是能够同时探索并结合多条可能的解题路径,随后再给出最终答案。
- 强化学习:模型使用专为多步推理、定理证明和解题数据设计的新型强化学习技术进行训练。
- 精选知识:系统提供了经过精选的高质量数学解答语料库,以及包含针对 IMO 级别问题的一般提示和技巧的具体指令。
对数学和 AGI 未来的影响
Google DeepMind 将此结果视为构建能够解决更复杂、更高级数学问题的 AI 的早期一步。尽管 2025 年的成功基于自然语言流畅度,实验室仍在继续开发诸如 AlphaGeometry 和 AlphaProof 等形式化系统。
DeepMind 认为,数学发现的未来在于将自然语言流畅性与形式语言中经验证的推理相结合的智能体。这类工具旨在帮助数学家、科学家和工程师在通往通用人工智能(AGI)的道路上推动人类知识的进步。
可用性
Deep Think 模型的一个版本将在向 Google AI Ultra 订阅者全面推送之前,先向包括数学家在内的一批可信测试者发布。