Gemma 3n 发布说明:多模态本地 AI
Gemma 3n 是一种原生多模态模型,专为本地硬件执行而设计,支持文本、图像、音频和视频输入。它的发布为开源社区提供了高性能、占用空间小的模型,能够在消费级 GPU 和移动设备上运行。
模型变体与内存效率
Gemma 3n 以两种主要规模发布,每种规模都有基础版和指令版。模型采用非标准命名法,其中 “E” 代表 “Effective”(有效)参数,这表明虽然实际参数数量更高,但内存效率的提升使其能够在显著更低的显存需求下运行。
- gemma-3n-E2B:实际参数量为 5B,但仅需 2GB GPU 内存。
- gemma-3n-E4B:实际参数量为 8B,但仅需 3GB GPU 内存。
技术架构
Gemma 3n 将语言解码器与专用的视觉和音频编码器相结合,实现原生多模态。
视觉与音频编码器
- Vision Encoder (MobileNet-V5):使用 300M 参数的 MobileNet-v5-300。支持 256x256、512x512 和 768x768 分辨率。在 Google Pixel 设备上实现 60 FPS,性能优于 ViT Giant,且参数量仅为其三分之一。
- Audio Encoder:基于通用语音模型(Universal Speech Model,USM),以 160ms 为单位处理音频,并支持语音转文本和翻译(例如英语到西班牙语或法语)。
架构创新
- MatFormer Architecture:一种嵌套式 Transformer 设计,允许将层的子集提取为独立模型。E2B 模型被配置为 E4B 的子模型,使用户能够根据特定的显存预算和硬件条件自由组合层。
- Per-Layer Embeddings (PLE):该技术通过将嵌入卸载到 CPU 来降低加速器内存使用,使得 5B 参数的 E2B 模型占用的显存相当于 2B 参数模型的大小。
- KV Cache Sharing:此功能加速音频和视频处理的预填充,相比 Gemma 3 4B 实现了 2 倍更快的预填充速度。
性能与能力
- LMArena 分数:E4B 模型是首个在 10B 以下实现 1300+ 分数的模型。
- 多语言支持:模型支持 140 种文本语言和 35 种多模态交互语言。
- 基准测试:在 MMLU 上,模型在 E4B、E2B 以及各种 Mix-n-Match 配置中表现出竞争力。
生态系统集成与部署
- Transformers & Timm:该架构及 MobileNet-v5 视觉编码器的参考实现。
- MLX:对所有三种模态(文本、图像、音频)提供 Day 0 支持。
- llama.cpp & Ollama:支持仅文本输入。
- Transformers.js & ONNXRuntime:
gemma-3n-E2B-it变体的 ONNX 权重已提供,并已集成到 Transformers.js 3.6.0 版本。 - Google AI Edge:支持本地设备部署。
微调与资源
开发者可以使用 Hugging Face Gemma Recipes 仓库对 Gemma 3n 进行特定任务的微调,该仓库包含脚本和笔记本。提供了针对 T4 GPU 的通用微调以及音频任务专用微调的 Google Colab 笔记本。