Gemma 4 發布說明:高智慧開放模型,用於推理與代理

Google DeepMind 已推出 Gemma 4,一個以 Apache 2.0 許可發布的開放模型家族,專為高階推理、代理工作流程以及高效的裝置端部署而設計。

模型變體與效能

Gemma 4 以四種不同規模發布,以在原始智慧與硬體效率之間取得平衡:

  • 31B Dense: 設計以達到最高品質,並作為微調的基礎。目前在 Arena AI 文字排行榜上全球排名第 #3 的開放模型。
  • 26B Mixture of Experts (MoE): 為低延遲優化,推論時僅啟用 38 億參數。於 Arena AI 文字排行榜上排名第 #6。
  • Effective 4B (E4B): 一款邊緣優化模型,優先考慮多模態能力與行動與物聯網裝置的低延遲處理。
  • Effective 2B (E2B): 高效能的邊緣模型,設計以在手機、Raspberry Pi 等裝置上最小化記憶體與電池消耗。

主要技術能力

進階推理與代理工作流程

模型能夠執行多步規劃與深層邏輯,在數學與指令遵循基準測試中顯示出顯著提升。為支援自主代理,Gemma 4 內建函式呼叫、結構化 JSON 輸出以及原生系統指令的支援。

多模態處理

所有 Gemma 4 模型皆原生支援影片與影像處理,支援可變解析度以及 OCR、圖表理解等任務。E2B 與 E4B 邊緣模型更進一步提供原生音訊輸入,以支援語音辨識與理解。

上下文窗口與語言支援

較大的 26B 與 31B 模型提供最高 256K 代幣的上下文窗口,而邊緣模型(E2B 與 E4B)則具備 128K 的上下文窗口。此系列模型原生於超過 140 種語言上進行訓練。

程式碼生成

Gemma 4 支援高品質的離線程式碼生成,使本地優先的 AI 程式碼助理成為可能。

硬體最佳化與部署

個人電腦與工作站

未量化的 bfloat16 權重對於 26B 與 31B 模型可容納於單顆 80GB NVIDIA H100 GPU。量化版本則提供給消費者級 GPU,以支援本地 IDE 與代理工作流程。

行動與物聯網邊緣裝置

E2B 與 E4B 模型被設計為最大化記憶體效率,能在 Android 裝置、Raspberry Pi 與 NVIDIA Jetson Orin Nano 上離線執行且延遲接近零。Android 開發者可透過 AICore Developer Preview 以相容 Gemini Nano 4 來原型化這些流程。

授權與生態系統

Apache 2.0 授權

Gemma 4 以商業友善的 Apache 2.0 授權發布,讓開發者對其資料、基礎設施與模型擁有完整控制權。

整合與工具

Gemma 4 在首日即支援廣泛的平臺與工具,包括:

  • Model Hubs: Hugging Face、Kaggle 與 Ollama。
  • Frameworks: Transformers、TRL、vLLM、llama.cpp、MLX 與 Keras。
  • Deployment: Google AI Studio、Vertex AI、Cloud Run、GKE 與 NVIDIA NIM。
  • Hardware: NVIDIA(從 Jetson Orin Nano 到 Blackwell GPU)、AMD(透過 ROCm 堆疊)與 Google TPU(Trillium 與 Ironwood)。

"在 Apache 2.0 授權下發布 Gemma 4 是一個巨大的里程碑。我們對於在 Hugging Face 上第一天就支援 Gemma 4 系列感到無比興奮。"

— Clément Delangue, co-founder and CEO, Hugging Face

Sources