Gemma 3n 版本說明:本機多模態 AI

Gemma 3n 是一個原生多模態模型,專為本地硬體執行而設計,支援文字、影像、音訊與影片輸入。此版本的發布為開源社群提供高效能、低佔用空間的模型,能在消費級 GPU 與行動裝置上運行。

模型變體與記憶體效能

Gemma 3n 以兩種主要規模發布,且每種規模都有基礎版與指令版。模型使用非標準的命名法,其中「E」代表「Effective」參數,表示雖然實際參數數量較高,但記憶體效能的提升使其能以顯著較低的 VRAM 需求運行。

  • gemma-3n-E2B:實際參數量為 5B,但僅需 2GB GPU 記憶體。
  • gemma-3n-E4B:實際參數量為 8B,但僅需 3GB GPU 記憶體。

技術架構

Gemma 3n 結合語言解碼器與專門的視覺與音訊編碼器,以實現原生多模態。

視覺與音訊編碼器

  • Vision Encoder (MobileNet-V5):使用 300M 參數的 MobileNet-v5-300。支援 256x256、512x512 與 768x768 的解析度。在 Google Pixel 裝置上可達 60 FPS,效能超過 ViT Giant,且參數量僅為其三分之一。
  • Audio Encoder:基於 Universal Speech Model(USM),以 160ms 為單位處理音訊,支援語音轉文字與翻譯(例如英語至西班牙語或法語)。

架構創新

  • MatFormer Architecture:一種巢狀 transformer 設計,允許將層的子集抽取為獨立模型。E2B 模型被配置為 E4B 的子模型,使用者可根據特定的記憶體預算與硬體,自由混搭層級。
  • Per-Layer Embeddings (PLE):此技術透過將嵌入向量卸載至 CPU,降低加速器記憶體使用量,使 5B 參數的 E2B 模型佔用相當於 2B 參數模型的 VRAM。
  • KV Cache Sharing:此功能加速音訊與影片處理的預填充,相較於 Gemma 3 4B 可達 2 倍更快的預填充速度。

效能與能力

Gemma 3n 展示了高效能與廣泛的語言覆蓋:

  • LMArena Score:E4B 模型是首個在 10B 以下達到 1300+ 分數的模型。
  • 多語言支援:模型支援 140 種文字語言與 35 種多模態互動語言。
  • 基準測試:模型在 MMLU 上於 E4B、E2B 以及各種 Mix-n-Match 配置中皆展現競爭力表現。

生態系統整合與部署

Gemma 3n 已整合至多個主要的開源函式庫與執行環境:

  • Transformers & Timm:提供架構與 MobileNet-v5 視覺編碼器的參考實作。
  • MLX:第一天即支援所有三種模態(文字、影像、音訊)。
  • llama.cpp & Ollama:支援僅文字輸入。
  • Transformers.js & ONNXRuntime:ONNX 權重已提供給 gemma-3n-E2B-it 變體,並整合至 Transformers.js 3.6.0 版。
  • Google AI Edge:支援本機部署。

微調與資源

開發者可使用 Hugging Face Gemma Recipes 倉庫中的腳本與筆記本,將 Gemma 3n 調整至特定任務。亦提供針對 T4 GPU 的一般微調以及音訊任務的專屬微調 Google Colab 筆記本。

Sources