Gemini 2.5 深度思考发布

Google DeepMind 已将 Deep Think 集成到 Gemini 应用中,供 Google AI Ultra 订阅者使用,实现了针对复杂问题求解的高级推理。本次发布引入了一个利用并行思考和延长推理时间的模型版本,以提升在数学、编码和科学研究等高度技术领域的性能。

并行思考与延长推理

Deep Think 通过采用并行思考技术提升了 Gemini 的推理能力,使模型能够在给出最终答案之前同时生成、评估并组合多个想法。该过程由两个主要技术驱动因素支持:

  • 延长的“思考时间”: 通过增加推理时间,模型可以探索更多假设并细化其对复杂问题的解决方案。
  • 强化学习: Google DeepMind 开发了新颖的强化学习技术,鼓励模型利用这些延长的推理路径,随着时间提升其直觉式问题解决能力。

性能与使用案例

Deep Think 旨在处理需要迭代开发、战略规划和逐步细化的任务。其主要优势领域包括:

编码与算法开发

Deep Think 在难度较高的编码问题上表现出色,这类问题对问题表述、时间复杂度以及权衡取舍尤为关键。它在 LiveCodeBench V6 上取得了领先水平的表现,该基准用于衡量竞争性编码能力。

科学与数学发现

该模型能够推理复杂的科学文献并提出数学猜想。虽然完整版本的 Gemini 2.5 Deep Think 在国际数学奥林匹克(IMO)中达到了金牌水平,但 Gemini 应用中提供的版本已针对日常使用进行优化,并在内部评估的 2025 年 IMO 基准上达到铜牌水平。

迭代设计

Deep Think 通过逐步构建复杂组件,提升网页开发任务的美观性和功能性。

除上述领域外,模型还在“Humanity’s Last Exam”(衡量科学与数学专业水平的基准)上取得了领先水平的表现。

安全性与责任

与 Gemini 2.5 Pro 相比,Gemini 2.5 Deep Think 展示了更好的内容安全性和语气客观性。然而,内部测试显示其对良性请求的拒绝倾向更高。Google DeepMind 正在进行前沿安全评估,并针对关键能力层级实施缓解措施,以应对因模型复杂度提升而带来的风险。

可用性与实现

Deep Think 在 Gemini 应用中向 Google AI Ultra 订阅者提供。用户可在模型下拉菜单中选择“2.5 Pro”,并在提示栏中切换“Deep Think”选项以激活。

关键运营细节包括:

  • 工具集成: Deep Think 可自动与 Google Search 和代码执行配合使用。
  • 响应长度: 模型能够生成显著更长的响应,相较于标准版本。
  • API 访问: Deep Think 的一个版本(含工具版和不含工具版)将在未来几周通过 Gemini API 向受信任的测试者发布,以供开发者和企业评估。

Sources