Gemma 4 12B 發佈說明 / 更新內容
Google 已發佈 Gemma 4 12B,這是一款中型多模態模型,旨在為消費級硬體帶來代理智能(agentic intelligence)。該模型填補了邊緣優化的 E4B 與較大的 26B Mixture of Experts (MoE) 模型之間的性能差距,在提供接近 26B 模型推理能力的同時,保持了足夠小的記憶體佔用,使其能夠在配備 16GB VRAM 或統一記憶體的筆記型電腦上本地運行。
統一無編碼器架構 (Unified Encoder-Free Architecture)
Gemma 4 12B 捨棄了傳統的多模態編碼器,以減少延遲和記憶體開銷。輸入不再使用獨立模型將圖像和音訊轉換為語言模型的表示形式,而是直接流入 LLM 主幹網路。
原生視覺處理
該模型使用輕量級嵌入模組(embedding module)取代了標準視覺編碼器。此模組由單次矩陣乘法、位置嵌入(positional embedding)和歸一化(normalizations)組成,允許 LLM 主幹網路直接處理視覺處理。
原生音訊處理
透過完全移除音訊編碼器,音訊處理進一步簡化。原始音訊訊號被直接投影到與文本標記(tokens)相同的維度空間中,使模型能夠離線進行語音輸入的轉錄、格式化和翻譯。
性能與本地部署
硬體需求與效率
Gemma 4 12B 針對本地執行進行了優化,需要 16GB RAM/VRAM。為了進一步降低延遲,該模型包含了多標記預測(Multi-Token Prediction, MTP)草稿模型(drafters)。
生態系統支援
該模型根據 Apache 2.0 授權條款發佈,並已整合至多種開發工具中:
- 推理引擎: 支援 llama.cpp, vLLM, SGLang, 和 MLX。
- 本地運行器: 可透過 LM Studio 和 Ollama 使用。
- 微調: 相容於 Unsloth。
- 部署: 可透過 Google Cloud (Cloud Run, GKE) 和 Gemini Enterprise Agent Platform Model Garden 進行部署。
開發者資源與代理工作流
為了促進 AI 代理的創建,Google 已發佈官方 Skills Repository,這是一個專門設計用於讓代理能使用 Gemma 模型進行構建的技能庫。
社群洞察與技術討論
關於此次發佈的開發者討論突顯了幾項技術考量與評論:
- 架構澄清: 部分開發者對「無編碼器」的說法提出疑問,指出嵌入模組在技術上仍是一種編碼形式,儘管沒有像 SigLIP 這樣專用的獨立模型。
- 量化: 有討論探討 16GB VRAM 的需求是否假設使用了量化(quantization),部分使用者認為這可能會導致品質損失。
- 市場定位: 一些觀察者指出,此模型填補了 Gemma 4 系列中的關鍵空白,提供了一個既能舒適地放入消費級 VRAM 中,同時又為上下文(context)留有空間的預訓練模型。
- Utility vs. MoE: 一些使用者建議 12B 模型是一個利基市場的發佈,認為 MoE 模型在速度和評分上可能因較低的活動權重(active weights)而表現更佳,使得 12B 模型在 RAM 受限的環境中特別有用。