Gemini 2.5 深度思考发布
Google DeepMind 已将 Deep Think 集成到 Gemini 应用中,供 Google AI Ultra 订阅者使用,实现了针对复杂问题求解的高级推理。本次发布引入了一个利用并行思考和延长推理时间的模型版本,以提升在数学、编码和科学研究等高度技术领域的性能。
并行思考与延长推理
Deep Think 通过采用并行思考技术提升了 Gemini 的推理能力,使模型能够在给出最终答案之前同时生成、评估并组合多个想法。该过程由两个主要技术驱动因素支持:
- 延长的“思考时间”: 通过增加推理时间,模型可以探索更多假设并细化其对复杂问题的解决方案。
- 强化学习: Google DeepMind 开发了新颖的强化学习技术,鼓励模型利用这些延长的推理路径,随着时间提升其直觉式问题解决能力。
性能与使用案例
Deep Think 旨在处理需要迭代开发、战略规划和逐步细化的任务。其主要优势领域包括:
编码与算法开发
Deep Think 在难度较高的编码问题上表现出色,这类问题对问题表述、时间复杂度以及权衡取舍尤为关键。它在 LiveCodeBench V6 上取得了领先水平的表现,该基准用于衡量竞争性编码能力。
科学与数学发现
该模型能够推理复杂的科学文献并提出数学猜想。虽然完整版本的 Gemini 2.5 Deep Think 在国际数学奥林匹克(IMO)中达到了金牌水平,但 Gemini 应用中提供的版本已针对日常使用进行优化,并在内部评估的 2025 年 IMO 基准上达到铜牌水平。
迭代设计
Deep Think 通过逐步构建复杂组件,提升网页开发任务的美观性和功能性。
除上述领域外,模型还在“Humanity’s Last Exam”(衡量科学与数学专业水平的基准)上取得了领先水平的表现。
安全性与责任
与 Gemini 2.5 Pro 相比,Gemini 2.5 Deep Think 展示了更好的内容安全性和语气客观性。然而,内部测试显示其对良性请求的拒绝倾向更高。Google DeepMind 正在进行前沿安全评估,并针对关键能力层级实施缓解措施,以应对因模型复杂度提升而带来的风险。
可用性与实现
Deep Think 在 Gemini 应用中向 Google AI Ultra 订阅者提供。用户可在模型下拉菜单中选择“2.5 Pro”,并在提示栏中切换“Deep Think”选项以激活。
关键运营细节包括:
- 工具集成: Deep Think 可自动与 Google Search 和代码执行配合使用。
- 响应长度: 模型能够生成显著更长的响应,相较于标准版本。
- API 访问: Deep Think 的一个版本(含工具版和不含工具版)将在未来几周通过 Gemini API 向受信任的测试者发布,以供开发者和企业评估。
Sources
- OriginalTry Deep Think in the Gemini app