Gemma 3n 版本說明 / 新功能

Google DeepMind 已發布 Gemma 3n,這是一個以行動為優先的多模態模型系列,旨在將前沿級別的能力帶到邊緣設備。此版本引入了一種巢狀變壓器架構,使模型能够在記憶體佔用顯著低於其原始參數數量的情況下運行,從而在僅有 2GB RAM 的硬體上實現高效能的多模態 AI。

多模態功能與效能

Gemma 3n 原生支援圖像、音訊、影像和文字輸入,並產生文字輸出。根據有效參數,它提供兩種主要尺寸:E2B 和 E4B。雖然原始參數數量分別為 5B 和 8B,但透過架構最佳化,它們能夠以 2GB (E2B) 和 3GB (E4B) 的記憶體佔用運行。

關鍵效能里程碑包括:

  • LMArena 分數: E4B 版本是首個在 100 億參數以下達成 LMArena 分數超過 1300 的模型。
  • 多語言性: 該模型支援 140 種語言的文字以及 35 種語言的多模態理解。
  • 一般改進: 在推理、編碼和數學方面的品質得到提升。

MatFormer: 彈性推理架構

Gemma 3n 建構在 MatFormer (Matryoshka Transformer) 架構之上,該架構利用巢狀變壓器來實現彈性推理。在此設計中,較大的模型包含較小的、完全功能的自身版本。

開發者可以以兩種方式利用此架構:

  1. 預先提取的模型: 使用者可以下載獨立的 E2B 子模型,相比 E4B 模型可實現最高 2 倍更快的推理。
  2. 混合搭配自訂: 使用 MatFormer Lab 工具,開發者可透過調整每層的前饋網路隱藏維度(範圍從 8192 到 16384)以及選擇性地跳過層,來在 E2B 與 E4B 之間建立自訂大小的模型。

儘管此架構尚未在當前發布中實作,但它使未來的「彈性執行」成為可能,允許單一部署的模型根據設備負載和任務需求在 E4B 與 E2B 推理路徑之間動態切換。

記憶體與處理最佳化

每層嵌入 (PLE)

每層嵌入 (PLE) 透過允許模型參數的重要部分(具體來說,與每層相關聯的嵌入)在 CPU 上進行計算,來提升記憶體效率。這確保只有核心變壓器權重(E2B 大約為 2B,E4B 大約為 4B)佔據受限的加速器記憶體 (VRAM)。

KV 快取共享

為了加速音訊和影像串流的長序列處理,Gemma 3n 實作了 KV 快取共享。透過將局部和全域注意力的中間層鍵值與所有頂層共享,該模型相較於 Gemma 3 4B 在預填充效能上提升了 2 倍,從而減少了串流應用的首個標記時間。

特化多模態編碼器

音訊理解

Gemma 3n 整合了一個基於通用語音模型 (USM) 的音訊編碼器,每 160ms 的音訊產生一個標記。這使得設備上的自動語音識別 (ASR) 和自動語音翻譯 (AST) 成為可能,尤其在英語與西班牙語、法語、義大利語和葡萄牙語之間的翻譯上表現尤為出色。

MobileNet-V5 視覺編碼器

該模型使用 MobileNet-V5-300M 視覺編碼器,該編碼器已針對邊緣設備進行優化。主要特徵包括:

  • 吞吐量: 在 Google Pixel 上可處理高達每秒 60 幀。
  • 靈活性: 支援 256x256、512x512 和 768x768 像素的輸入解析度。
  • 效能: 與 Gemma 3 中的基線 SoViT 相比,MobileNet-V5-300M 在啟用量化時提供 13 倍的加速(未量化時為 6.5 倍),參數數量減少 46%,且記憶體佔用縮小 4 倍。

生態系統與部署

Gemma 3n 獲得廣泛的開源工具與框架支援,包括 Hugging Face Transformers、llama.cpp、Ollama、MLX、Google AI Edge 和 vLLM。部署選項從 Google AI Studio 和 Vertex AI 範圍延伸至 NVIDIA API Catalog 和 Cloud Run。

Sources