Gemini 3 版本說明
Google DeepMind 已推出 Gemini 3,截至目前其最智能的模型,旨在整合多模態理解、先進推理及具代理能力,以協助使用者學習、建構與規劃。此版本包含 Gemini 3 Pro,一種在 Google 產品中皆可使用的高效能模型,以及 Gemini 3 Deep Think,一種針對高度複雜任務的增強推理模式。
最先進的推理與基準測試
Gemini 3 Pro 在所有主要 AI 基準測試中顯著優於 Gemini 2.5 Pro,在推理、數據及事實準確性方面樹立了新標準。
效能指標
- 一般智能: Gemini 3 Pro 在 LMArena 排行榜上以 1501 Elo 分數排名第一。
- 博士級推理: 該模型在 Humanity’s Last Exam(未使用工具)上達到 37.5%,在 GPQA Diamond 上達到 91.9%。
- 數學: 它在 MathArena Apex 上達到 23.4%,創下新的前沿模型最佳狀態。
- 多模態推理: Gemini 3 Pro 在 MMMU-Pro 上獲得 81%,在 Video-MMMU 上獲得 87.6%。
- 事實準確性: 該模型在 SimpleQA Verified 上達到 72.1%。
Gemini 3 Deep Think
Gemini 3 Deep Think 是一種專門模式,進一步推升推理界限。在測試中,它達到:
- Humanity’s Last Exam: 41.0% (未使用工具)。
- GPQA Diamond: 93.8%。
- ARC-AGI-2: 45.1% (含程式執行,ARC Prize 已驗證),展示了解決新穎挑戰的能力。
多模態學習與搜尋整合
Gemini 3 結合了 100 萬個 token 的上下文視窗與先進的視覺與空間理解,以跨越文字、圖像、影片、音訊與程式碼來綜合資訊。
教育應用
Gemini 3 能將多語言的手寫食譜翻譯成食譜書,或分析學術論文及長影片講座以生成互動閃卡與視覺化。它也能分析運動影片(例如:pickleball)以提供姿勢改進與訓練計畫。
搜尋中的 AI 模式
這是首次,Gemini 在第一天就隨 Google Search 一起推出。搜尋中的 AI 模式使用 Gemini 3 來創建生成式 UI 體驗,包括沉浸式視覺佈局以及基於使用者查詢即時生成的互動模擬。
具代理能力的編程與 Google Antigravity
Gemini 3 被定位為一種強大的「vibe coding」具代理能力模型,旨在自動化複雜的軟體任務並提升開發者生產力。
編程基準測試
- 網頁開發: Gemini 3 在 WebDev Arena 排行榜上以 1487 Elo 排名第一。
- 工具使用: 其在 Terminal-Bench 2.0 上獲得 54.2%,測試透過終端機操作電腦的能力。
- 編程代理: 在 SWE-bench Verified 上,它顯著優於 Gemini 2.5 Pro,得分 76.2%。
Google Antigravity
Google 已推出 Google Antigravity,這是一個以代理為優先的開發平台。與傳統的 AI IDE 不同,Antigravity 的代理能直接存取編輯器、終端機與瀏覽器,使其能自主規劃、執行並驗證端到端的軟體任務。此平台整合了 Gemini 3 Pro、用於瀏覽器控制的 Gemini 2.5 Computer Use 模型,以及 Nano Banana(Gemini 2.5 Image)圖像編輯模型。
長遠規劃與個人代理
Gemini 3 Pro 提升了在較長時間範圍內可靠規劃並保持一致決策的能力。
- Vending-Bench 2: Gemini 3 Pro 在此排行榜上排名第一,在模擬的一年業務運營中保持一致的工具使用與決策,未偏離任務。
- 日常實用: 這些改進使模型能透過 Google AI Ultra 訂閱者可使用的 Gemini Agent 處理多步驟工作流程,例如整理收件匣或預訂當地服務。
安全與責任
Gemini 3 已接受至今為止任何 Google AI 模型中最全面的安全評估。主要改進包括:
- 減少奉承: 該模型不太可能只是單純同意使用者。
- 安全: 對提示注入的抵抗力增強,並提升對網路攻擊的防護。
- 外部驗證: 評估是在與領域專家、英國 AISI 以及包括 Apollo、Vaultis 和 Dreadnode 在內的獨立公司合作下進行的。