Gemini 3 Deep Think 更新
Google DeepMind 已发布对 Gemini 3 Deep Think 的重大升级,这是一种专为解决科学、研究和工程中的复杂挑战而设计的专门推理模式。此更新侧重于提供数学和算法的严谨性,以应对缺乏明确约束或唯一正确解的问题,这类问题常常涉及混乱或不完整的数据。
先进的推理与算法性能
Gemini 3 Deep Think 在多个严格的学术和竞赛基准上达到了新的性能高度。更新后的模型取得了以下结果:
- Humanity’s Last Exam:48.4% 准确率(不使用工具),为旨在测试前沿模型极限的基准设定了新标准。
- ARC-AGI-2:84.6% 准确率,经 ARC 奖金基金会验证。
- Codeforces:在竞技编程挑战中获得 3455 Elo。
- International Math Olympiad (IMO) 2025:金牌水平表现。
科学领域的熟练度
除了数学和编码,更新后的 Deep Think 模式在广泛的科学领域,尤其是化学和物理方面表现出色。它在 2025 年国际物理奥林匹克和 2025 年化学奥林匹克的笔试部分展示了金牌水平的成绩。此外,模型在 CMT-Benchmark 上取得 50.5% 的得分,展示了在高级理论物理方面的熟练度。
实际工程应用
Gemini 3 Deep Think 旨在超越抽象理论,实现实际效用。该模型使研究人员能够解释复杂数据,并让工程师通过代码对物理系统进行建模。这一能力的具体应用之一是通过分析图纸、建模复杂形状并生成 3D 打印所需文件,将草图转换为可 3D 打印的文件。
可用性与访问
更新后的 Deep Think 模式已在 Google AI Ultra 订阅者的 Gemini 应用中立即可用。首次,Deep Think 还通过 Gemini API 向特定研究人员、工程师和企业提供早期访问计划。