Gemini 3 发布说明
Google DeepMind 已推出 Gemini 3,这是其迄今为止最智能的模型,旨在整合多模态理解、高级推理和智能体能力,以帮助用户学习、构建和规划。该版本包括 Gemini 3 Pro,这是一种在 Google 产品中提供的高性能模型,以及 Gemini 3 Deep Think,这是一种增强的推理模式,用于处理高度复杂的任务。
最先进的推理和基准测试
Gemini 3 Pro 在所有主要 AI 基准测试中显著优于 Gemini 2.5 Pro,在推理、数学和事实准确性方面树立了新的标准。
性能指标
- 通用智能: Gemini 3 Pro 在 LMArena 排行榜上以 1501 Elo 的得分排名第一。
- 博士级推理: 该模型在 Humanity’s Last Exam(未使用工具)上达到 37.5%,在 GPQA Diamond 上达到 91.9%。
- 数学: 它在 MathArena Apex 上达到 23.4%,创下前沿模型的最佳状态。
- 多模态推理: Gemini 3 Pro 在 MMMU-Pro 上得分 81%,在 Video-MMMU 上得分 87.6%。
- 事实准确性: 它在 SimpleQA Verified 上达到 72.1%。
Gemini 3 Deep Think
Gemini 3 Deep Think 是一种专门的模式,进一步推动了推理的边界。在测试中,它实现了:
- Humanity’s Last Exam: 41.0%(未使用工具)。
- GPQA Diamond: 93.8%。
- ARC-AGI-2: 45.1%(带代码执行,ARC Prize Verified),展示了解决新颖挑战的能力。
多模态学习与搜索集成
Gemini 3 将 100 万令牌的上下文窗口与先进的视觉和空间理解相结合,以跨文本、图像、视频、音频和代码合成信息。
教育应用
Gemini 3 可以将多语言的手写食谱翻译成食谱书,或分析学术论文和长视频讲座以生成交互式闪卡和可视化。它还可以分析体育视频(例如 pickleball)以提供姿势改进和训练计划。
搜索中的 AI 模式
首次,Gemini 在第一天就随 Google Search 一起发布。搜索中的 AI 模式利用 Gemini 3 创建生成式 UI 体验,包括沉浸式视觉布局和基于用户查询实时生成的交互式模拟。
智能体编码与 Google Antigravity
Gemini 3 被定位为一个强大的“vibe coding”和智能体模型,旨在自动化复杂的软件任务并提高开发者生产力。
编码基准测试
- 网页开发: Gemini 3 在 WebDev Arena 排行榜上以 1487 Elo 排名第一。
- 工具使用: 它在 Terminal-Bench 2.0 上得分 54.2%,测试通过终端操作计算机的能力。
- 编码智能体: 它在 SWE-bench Verified 上显著优于 Gemini 2.5 Pro,得分 76.2%。
Google Antigravity
Google 已推出 Google Antigravity,这是一个以智能体为先的开发平台。与传统的 AI IDE 不同,Antigravity 的智能体可以直接访问编辑器、终端和浏览器,使它们能够自主规划、执行和验证端到端的软件任务。该平台集成了 Gemini 3 Pro、用于浏览器控制的 Gemini 2.5 Computer Use 模型以及 Nano Banana(Gemini 2.5 Image)图像编辑模型。
长期规划与个人能动性
Gemini 3 Pro 提升了在更长时间范围内可靠规划并保持一致决策的能力。
- Vending-Bench 2: Gemini 3 Pro 在此排行榜上排名第一,在模拟的一年业务运营中保持一致的工具使用和决策,而不会偏离任务。
- 日常实用: 这些改进使模型能够通过 Google AI Ultra 订阅者可用的 Gemini Agent 处理多步骤工作流,例如整理收件箱或预订本地服务。
安全与责任
Gemini 3 已接受迄今为止任何 Google AI 模型中最全面的安全评估。主要改进包括:
- 减少奉承: 该模型不太可能仅仅同意用户。
- 安全: 对提示注入的抵抗力增强,并改进了对网络攻击的防护。
- 外部验证: 评估是在与主题专家、英国 AISI 以及包括 Apollo、Vaultis 和 Dreadnode 在内的独立公司合作下进行的。