Gemini 3 Pro 版本說明

Google DeepMind 已推出 Gemini 3 Pro,這是一種高智能模型模型,旨在增強具代理能力的工作流程和複雜的模型,旨在增強具代理能力的工作流程和複雜的零樣本任務。Gemini 3 Pro 在所有主要 AI 基準測試中均優於先前版本,特別是在編碼和推理能力方面超越 Gemini 2.5 Pro。

具代理能力的編程與開發工具

Gemini 3 Pro 作為具代理能力編程的基礎,在 Terminal-Bench 2.0 上獲得 54.2% 的分數,該測量衡量模型透過終端機操作電腦的能力。該模型已整合到多個開發工具中,包括 Android Studio、Gemini CLI、Cursor、GitHub、JetBrains、Manus 和 Cline。

Google Antigravity

Google Antigravity 是一種新的具代理能力開發平台,允許開發者擔任架構師,同時在工作區間管理自主代理。這些代理可以在編輯器、終端機和瀏覽器之間運行,以規劃和執行複雜的軟體驗,以規劃和執行複雜的軟體任務,並透過詳細的構件傳遞進度。該平台在 MacOS、Windows 和 Linux 上提供公開預覽版。

Gemini API 增強

已將新工具加入 Gemini API,以支援具代理能力的工作流程:

  • Bash Tools: 客戶端 bash 工具允許模型提出用於本地檔案系統導航和系統自動化的 shell 指令。另有一個託管的伺服器端 bash 工具,可用於安全的原型設計和多語言程式碼生成。
  • Structured Outputs: 現在可以將 Google Search 的基礎與 URL 上下文結合為結構化輸出,從而方便將數據提取為特定格式,以供下游具代理能力的任務使用。

Vibe 編碼與快速原型製作

Gemini 3 Pro 能夠實現「vibe 編碼」,其中自然語言是應用程式開發的主要語法。該模型在 WebDev Arena 排行榜上獲得 1487 Elo 分數,反映其透過單一提示將高層次概念轉化為互動應用程式的能力。

Google AI Studio Build Mode

Google AI Studio 的 Build 模式允許開發者透過自動連接模型和 API,快速從提示構建 AI 原生應用。該模型改進的指令遵循能力使得可以從單一提示、語音備忘錄或紙本草圖創建完全功能的應用程式,例如復古遊戲或互動落地頁。

多模態理解與空間推理

Gemini 3 Pro 被定位為複雜多模態理解的領先模型,在 MMMU-Pro(圖像推理)和 Video MMMU(視頻理解)上設定了新的基準。它擁有 100 萬個 token 的上下文窗口。

視覺與空間推理

  • Document Understanding: 該模型超越 OCR,能夠對複雜文件進行智能推理。
  • Spatial Understanding: Gemini 3 Pro 在具體化推理任務中表現出色,包括軌跡預測和指向,這些適用於自動駕駛車輛、機器人和 XR 裝置。
  • Screen Understanding: 該模型能夠解讀桌面和行動作業系統的螢幕,包括透過滑鼠移動和螢幕註解得出的使用者意圖,以驅動電腦使用代理。

視頻推理

Gemini 3 Pro 支援高幀率理解以捕捉快速動作,並利用長上下文回憶來跨數小時的影像合成敘事。根據 OpusClip 的 CTO Jay Wu 的說法,該模型在視頻代理推理和工具調用方面相較於先前的實作提升了 32% 的速度。

技術規格與可用性

Gemini 3 Pro 可透過 Google AI Studio 和 Vertex AI(適用於企業)的 Gemini API 以預覽版取得。

200k 個 token 或以下的提示定價:

  • Input: 每百萬 token 2 美元
  • Output: 每百萬 token 12 美元

API 控制: 為了支援更深層的推理,API 現在包含一個新的思考層級參數、用於多模態視覺處理的細緻媒體解析度設定,以及更嚴格的思考簽名驗證,以在多輪對話中保持上下文。

Sources