Gemma 4 12B 版本說明 / 新功能

Gemma 4 12B 版本說明 / 新功能

Google DeepMind 已推出 Gemma 4 12B,一種中等規模的多模態模型,旨在將代理智能帶到本地硬體。透過使用統一的、無編碼器架構,該模型提供的性能接近其更大的 26B 混合專家(MoE)對應版本,同時保持足夠小的記憶體佔用,可在配備 16GB VRAM 或統一記憶體的消費者筆電上運行。

無編碼器統一架構

Gemma 4 12B 消除了傳統的多模態編碼器以降低延遲和記憶體使用。與其使用單獨的編碼器先將圖像和音訊翻譯後再傳遞給語言模型,視覺和音訊輸入直接流入 LLM 骨幹。

原生視覺處理

該模型用輕量級嵌入模組取代標準視覺編碼器。該模組由單一矩陣乘法、位置嵌入和正規化組成,使 LLM 骨幹能夠直接處理視覺資訊。

原生音訊處理

透過完全移除音訊編碼器,音訊處理進一步簡化。原始音訊訊號直接投射到與文字標記相同的維度空間,使模型能夠離線轉錄、格式化和翻譯語音輸入。

性能與代理能力

Gemma 4 12B 被定位為連接邊界友好的 E4B 與 26B MoE 模型的橋樑。它提供的基準性能接近 26B 模型,這使得能夠在本地處理多步驟推理和複雜的代理工作流程。

為了支援這些能力,Google 正在發布官方 Skills Repository,這是一個專門設計來讓代理使用 Gemma 模型構建的技能庫。

部署與可訪問性

根據 Apache 2.0 授權發布,Gemma 4 12B 透過多種渠道對開發者生態系統可訪問:

  • 本地推理: 透過 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent app 和 LiteRT-LM CLI 支持。
  • 權重與框架: 預訓練和指令調整的檢查點可在 Hugging Face 和 Kaggle 獲得。實作支援 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM。
  • 微調: 透過 Unsloth 提供高效微調。
  • 雲端部署: 生產端點可透過 Google Cloud 部署,包括 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE。

延遲優化

為降低推理延遲,Gemma 4 12B 配備了 Multi-Token Prediction (MTP) 草稿器,使其具備「草稿就緒」特性,以實現更快速的回應生成。

Sources