Nano Banana Pro (Gemini 3 Pro Image) 發佈

Google DeepMind 已發佈 Nano Banana Pro (Gemini 3 Pro Image),這是一款高保真度的圖像生成與編輯模型,為開發者提供工作室級別的圖像生成能力與進階的創意控制。該模型基於 Gemini 3 Pro 構建,專為專業製作設計,在文字渲染方面提供更高的準確度、強大的世界知識,並能與 Google Search 整合以提供具備事實根據且由數據驅動的輸出。

專業級保真度與創意控制

Gemini 3 Pro Image 可對圖像構圖與物理特性進行精確控制,包括光照、相機設置、對焦與色彩分級。為了符合專業製作標準,該模型支援 2K 與 4K 解析度。

用於協同資產創建的核心能力包括:

  • Reference Integration: 模型可以將標誌 (logos)、產品圖像與參考資料等各種元素整合到單一廣告中。
  • Consistency: 模型可以維持最多五個人的外貌一致性。
  • Input Blending: 模型支援整合多達六張高保真度照片,或將多達十四個標準輸入混合成單一精緻的輸出結果。

進階文字渲染與在地化

與之前的 2.5 Flash Image 模型相比,Gemini 3 Pro Image 在文字渲染方面提供了顯著的改進,能夠在圖像中直接生成清晰且準確的文字。這項能力使其非常適合用於創建功能性資產,例如行銷素材與教育內容。

除了生成之外,該模型還透過圖像到圖像 (image-to-image) 生成支援在地化邏輯。藉由理解圖像的語義上下文,它可以更改標牌、菜單或文件等元素的語言,同時保留原始的藝術風格與佈局。

事實根據與世界知識

為了產出更具事實根據的資產,Gemini 3 Pro Image 利用了龐大的知識庫,並能透過與 Google Search 的 grounding 整合,連接到即時的網路內容。這種整合對於需要高精度的應用程式(例如歷史地圖或生物圖解)特別有用。

生態系統整合與安全性

Gemini 3 Pro Image 正透過多種管道整合至開發者生態系統中:

  • Google Antigravity: 此代理開發平台上的編碼代理 (coding agents) 可以使用該模型在編寫代碼之前生成 UI 模擬圖與視覺資產。
  • Creative Platforms: 該模型正被整合至 Adobe 與 Figma。
  • Developer Access: 該模型已透過 Google AI Studio 中的 Gemini API 提供付費預覽版,並在 Vertex AI 中提供給企業使用。

為了確保 AI 生成媒體的來源可追溯性,使用 Gemini 3 Pro Image 創建或編輯的每張圖像都包含整合的 SynthID 數位浮水印。

模型比較:Nano Banana vs. Nano Banana Pro

開發者可以根據其特定需求在兩種模型之間進行選擇:

  • Gemini 2.5 Flash Image (Nano Banana): 針對更快速、更低成本的圖像生成進行了優化。
  • Gemini 3 Pro Image (Nano Banana Pro): 針對更高品質的圖像生成進行了優化,但伴隨著較高的成本與延遲。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch