Gemini 3 发布说明

Google DeepMind 已推出 Gemini 3,这是其迄今为止最智能的模型,旨在整合多模态理解、高级推理和智能体能力,以帮助用户学习、构建和规划。该版本包括 Gemini 3 Pro,这是一种在 Google 产品中提供的高性能模型,以及 Gemini 3 Deep Think,这是一种增强的推理模式,用于处理高度复杂的任务。

最先进的推理和基准测试

Gemini 3 Pro 在所有主要 AI 基准测试中显著优于 Gemini 2.5 Pro,在推理、数学和事实准确性方面树立了新的标准。

性能指标

  • 通用智能: Gemini 3 Pro 在 LMArena 排行榜上以 1501 Elo 的得分排名第一。
  • 博士级推理: 该模型在 Humanity’s Last Exam(未使用工具)上达到 37.5%,在 GPQA Diamond 上达到 91.9%。
  • 数学: 它在 MathArena Apex 上达到 23.4%,创下前沿模型的最佳状态。
  • 多模态推理: Gemini 3 Pro 在 MMMU-Pro 上得分 81%,在 Video-MMMU 上得分 87.6%。
  • 事实准确性: 它在 SimpleQA Verified 上达到 72.1%。

Gemini 3 Deep Think

Gemini 3 Deep Think 是一种专门的模式,进一步推动了推理的边界。在测试中,它实现了:

  • Humanity’s Last Exam: 41.0%(未使用工具)。
  • GPQA Diamond: 93.8%。
  • ARC-AGI-2: 45.1%(带代码执行,ARC Prize Verified),展示了解决新颖挑战的能力。

多模态学习与搜索集成

Gemini 3 将 100 万令牌的上下文窗口与先进的视觉和空间理解相结合,以跨文本、图像、视频、音频和代码合成信息。

教育应用

Gemini 3 可以将多语言的手写食谱翻译成食谱书,或分析学术论文和长视频讲座以生成交互式闪卡和可视化。它还可以分析体育视频(例如 pickleball)以提供姿势改进和训练计划。

搜索中的 AI 模式

首次,Gemini 在第一天就随 Google Search 一起发布。搜索中的 AI 模式利用 Gemini 3 创建生成式 UI 体验,包括沉浸式视觉布局和基于用户查询实时生成的交互式模拟。

智能体编码与 Google Antigravity

Gemini 3 被定位为一个强大的“vibe coding”和智能体模型,旨在自动化复杂的软件任务并提高开发者生产力。

编码基准测试

  • 网页开发: Gemini 3 在 WebDev Arena 排行榜上以 1487 Elo 排名第一。
  • 工具使用: 它在 Terminal-Bench 2.0 上得分 54.2%,测试通过终端操作计算机的能力。
  • 编码智能体: 它在 SWE-bench Verified 上显著优于 Gemini 2.5 Pro,得分 76.2%。

Google Antigravity

Google 已推出 Google Antigravity,这是一个以智能体为先的开发平台。与传统的 AI IDE 不同,Antigravity 的智能体可以直接访问编辑器、终端和浏览器,使它们能够自主规划、执行和验证端到端的软件任务。该平台集成了 Gemini 3 Pro、用于浏览器控制的 Gemini 2.5 Computer Use 模型以及 Nano Banana(Gemini 2.5 Image)图像编辑模型。

长期规划与个人能动性

Gemini 3 Pro 提升了在更长时间范围内可靠规划并保持一致决策的能力。

  • Vending-Bench 2: Gemini 3 Pro 在此排行榜上排名第一,在模拟的一年业务运营中保持一致的工具使用和决策,而不会偏离任务。
  • 日常实用: 这些改进使模型能够通过 Google AI Ultra 订阅者可用的 Gemini Agent 处理多步骤工作流,例如整理收件箱或预订本地服务。

安全与责任

Gemini 3 已接受迄今为止任何 Google AI 模型中最全面的安全评估。主要改进包括:

  • 减少奉承: 该模型不太可能仅仅同意用户。
  • 安全: 对提示注入的抵抗力增强,并改进了对网络攻击的防护。
  • 外部验证: 评估是在与主题专家、英国 AISI 以及包括 Apollo、Vaultis 和 Dreadnode 在内的独立公司合作下进行的。

Sources