Gemma 3n 版本說明 / 新功能
Google DeepMind 已發布 Gemma 3n,這是一個以行動為優先的多模態模型系列,旨在將前沿級別的能力帶到邊緣設備。此版本引入了一種巢狀變壓器架構,使模型能够在記憶體佔用顯著低於其原始參數數量的情況下運行,從而在僅有 2GB RAM 的硬體上實現高效能的多模態 AI。
多模態功能與效能
Gemma 3n 原生支援圖像、音訊、影像和文字輸入,並產生文字輸出。根據有效參數,它提供兩種主要尺寸:E2B 和 E4B。雖然原始參數數量分別為 5B 和 8B,但透過架構最佳化,它們能夠以 2GB (E2B) 和 3GB (E4B) 的記憶體佔用運行。
關鍵效能里程碑包括:
- LMArena 分數: E4B 版本是首個在 100 億參數以下達成 LMArena 分數超過 1300 的模型。
- 多語言性: 該模型支援 140 種語言的文字以及 35 種語言的多模態理解。
- 一般改進: 在推理、編碼和數學方面的品質得到提升。
MatFormer: 彈性推理架構
Gemma 3n 建構在 MatFormer (Matryoshka Transformer) 架構之上,該架構利用巢狀變壓器來實現彈性推理。在此設計中,較大的模型包含較小的、完全功能的自身版本。
開發者可以以兩種方式利用此架構:
- 預先提取的模型: 使用者可以下載獨立的 E2B 子模型,相比 E4B 模型可實現最高 2 倍更快的推理。
- 混合搭配自訂: 使用 MatFormer Lab 工具,開發者可透過調整每層的前饋網路隱藏維度(範圍從 8192 到 16384)以及選擇性地跳過層,來在 E2B 與 E4B 之間建立自訂大小的模型。
儘管此架構尚未在當前發布中實作,但它使未來的「彈性執行」成為可能,允許單一部署的模型根據設備負載和任務需求在 E4B 與 E2B 推理路徑之間動態切換。
記憶體與處理最佳化
每層嵌入 (PLE)
每層嵌入 (PLE) 透過允許模型參數的重要部分(具體來說,與每層相關聯的嵌入)在 CPU 上進行計算,來提升記憶體效率。這確保只有核心變壓器權重(E2B 大約為 2B,E4B 大約為 4B)佔據受限的加速器記憶體 (VRAM)。
KV 快取共享
為了加速音訊和影像串流的長序列處理,Gemma 3n 實作了 KV 快取共享。透過將局部和全域注意力的中間層鍵值與所有頂層共享,該模型相較於 Gemma 3 4B 在預填充效能上提升了 2 倍,從而減少了串流應用的首個標記時間。
特化多模態編碼器
音訊理解
Gemma 3n 整合了一個基於通用語音模型 (USM) 的音訊編碼器,每 160ms 的音訊產生一個標記。這使得設備上的自動語音識別 (ASR) 和自動語音翻譯 (AST) 成為可能,尤其在英語與西班牙語、法語、義大利語和葡萄牙語之間的翻譯上表現尤為出色。
MobileNet-V5 視覺編碼器
該模型使用 MobileNet-V5-300M 視覺編碼器,該編碼器已針對邊緣設備進行優化。主要特徵包括:
- 吞吐量: 在 Google Pixel 上可處理高達每秒 60 幀。
- 靈活性: 支援 256x256、512x512 和 768x768 像素的輸入解析度。
- 效能: 與 Gemma 3 中的基線 SoViT 相比,MobileNet-V5-300M 在啟用量化時提供 13 倍的加速(未量化時為 6.5 倍),參數數量減少 46%,且記憶體佔用縮小 4 倍。
生態系統與部署
Gemma 3n 獲得廣泛的開源工具與框架支援,包括 Hugging Face Transformers、llama.cpp、Ollama、MLX、Google AI Edge 和 vLLM。部署選項從 Google AI Studio 和 Vertex AI 範圍延伸至 NVIDIA API Catalog 和 Cloud Run。