Gemini 3 Pro 发布说明

Google DeepMind 已推出 Gemini 3 Pro,这是一种高智能模型,旨在增强智能体工作流和复杂零样本任务。Gemini 3 Pro 在所有主要 AI 基准测试中均优于之前的版本,并且在编码和推理能力方面特别超越了 Gemini 2.5 Pro。

智能体编码与开发工具

Gemini 3 Pro 作为智能体编码的基础,在 Terminal-Bench 2.0 上获得了 54.2% 的得分,该基准衡量模型通过终端操作计算机的能力。该模型已集成到多个开发工具中,包括 Android Studio、Gemini CLI、Cursor、GitHub、JetBrains、Manus 和 Cline。

Google Antigravity

Google Antigravity 是一个新的智能体开发平台,允许开发者充当架构师,同时在工作区中管理自主智能体。这些智能体可以在编辑器、终端和浏览器之间运行,以规划和执行复杂的软件任务,并通过详细的制品传达进展。该平台在 MacOS、Windows 和 Linux 上提供公开预览版。

Gemini API 增强

已向 Gemini API 添加新工具以支持智能体工作流:

  • Bash Tools: 客户端 bash 工具使模型能够提出用于本地文件系统导航和系统自动化的 shell 命令。托管的服务器端 bash 工具也可用于安全原型设计和多语言代码生成。
  • Structured Outputs: 通过 Google Search 和 URL 上下文进行的基础现在可以与结构化输出结合,便于将数据提取为特定格式,以供下游智能体任务使用。

氛围编码与快速原型

Gemini 3 Pro 启用了 "vibe coding",其中自然语言是应用开发的主要语法。该模型在 WebDev Arena 排行榜上获得了 1487 Elo 分数,反映了其通过单个提示将高级想法转化为交互式应用的能力。

Google AI Studio 构建模式

Google AI Studio 的构建模式使开发者能够通过自动连接模型和 API,快速从提示生成 AI 原生应用。模型改进的指令遵循能力使得可以从单个提示、语音备忘录或草图草稿创建完全功能的应用,例如复古游戏或交互式登陆页面。

多模态理解与空间推理

Gemini 3 Pro 被定位为复杂多模态理解的领先模型,在 MMMU-Pro(图像推理)和 Video MMMU(视频理解)上设定了新的基准。它具有 100 万标记的上下文窗口。

视觉与空间推理

  • Document Understanding: 模型超越 OCR,能够对复杂文档进行智能推理。
  • Spatial Understanding: Gemini 3 Pro 在具身推理任务中表现出色,包括轨迹预测和指向,适用于自动驾驶汽车、机器人和 XR 设备。
  • Screen Understanding: 模型能够解读桌面和移动操作系统屏幕,包括从鼠标移动和屏幕注释中得出的用户意图,以驱动计算机使用代理。

视频推理

Gemini 3 Pro 支持高帧率理解以捕捉快速动作,并利用长上下文回忆来跨数小时的素材合成叙事。根据 OpusClip 首席技术官 Jay Wu 的说法,该模型在视频智能体推理和工具调用方面相比之前的实现提高了 32% 的速度。

技术规格与可用性

Gemini 3 Pro 可通过 Google AI Studio 和 Vertex AI 中的 Gemini API 以预览版形式供企业使用。

Pricing for prompts 200k tokens or less:

  • Input: $2/百万标记
  • Output: $12/百万标记

API Controls: 为了支持更深入的推理,API 现在包含一个新的思考级别参数、用于多模态视觉处理的细粒度媒体分辨率设置,以及对思维签名的更严格验证,以在多轮对话中保持上下文。

Sources