Gemma 3n 发布说明 / 新功能
Google DeepMind 已发布 Gemma 3n,这是一款面向移动端的多模态模型系列,旨在将前沿级别的能力带到边缘设备。此次发布引入了嵌套 Transformer 架构,使模型的内存占用远小于其原始参数量,从而在仅有 2GB RAM 的硬件上实现高性能多模态 AI。
多模态能力与性能
Gemma 3n 原生支持图像、音频、视频和文本输入,并输出文本。它提供两种主要规模,基于有效参数量:E2B 和 E4B。虽然原始参数量分别为 5B 和 8B,但架构优化使它们的内存占用分别为 2GB(E2B)和 3GB(E4B)。
关键性能里程碑包括:
- LMArena 分数:
E4B版本是首个参数量低于 100 亿且 LMArena 分数超过 1300 的模型。 - 多语言能力: 这些模型支持 140 种语言的文本以及 35 种语言的多模态理解。
- 整体改进: 推理、编码和数学等方面的质量得到提升。
MatFormer:弹性推理架构
Gemma 3n 基于 MatFormer(Matryoshka Transformer)架构构建,该架构利用嵌套的 Transformer 实现弹性推理。在此设计中,较大的模型包含其更小且功能完整的版本。
开发者可以通过两种方式使用该架构:
- 预提取模型: 用户可以下载独立的
E2B子模型,其推理速度比E4B模型快约 2 倍。 - 混搭定制: 使用 MatFormer Lab 工具,开发者可以通过调整每层前馈网络的隐藏维度(范围 8192 至 16384)并有选择地跳过层,创建介于
E2B与E4B之间的自定义规模模型。
虽然在当前发布中尚未实现,但该架构为未来的“弹性执行”奠定基础,使单一部署模型能够根据设备负载和任务需求,在 E4B 与 E2B 推理路径之间动态切换。
内存与处理优化
每层嵌入 (PLE)
每层嵌入(PLE)通过让模型的大量参数——尤其是每层关联的嵌入——在 CPU 上计算,从而提升内存效率。这确保只有核心 Transformer 权重(E2B 大约 2B,E4B 大约 4B)占用受限的加速器内存(VRAM)。
KV 缓存共享
为加速音频和视频流中长序列的处理,Gemma 3n 实现了 KV 缓存共享。通过将局部和全局注意力中间层的键和值共享给所有顶层,模型在预填充性能上比 Gemma 3 4B 提升约 2 倍,缩短了流式应用的首 token 响应时间。
专用多模态编码器
音频理解
Gemma 3n 集成了基于通用语音模型(USM)的音频编码器,每 160ms 音频生成一个 token。这实现了设备端的自动语音识别(ASR)和自动语音翻译(AST),在英-西、英-法、英-意、英-葡等语言对的翻译上表现尤为出色。
MobileNet-V5 视觉编码器
模型使用了针对边缘设备优化的 MobileNet-V5-300M 视觉编码器。关键特性包括:
- 吞吐量: 在 Google Pixel 上可实现最高 60 帧/秒的处理。
- 灵活性: 支持 256x256、512x512 和 768x768 像素的输入分辨率。
- 效率: 相较于 Gemma 3 中的基线 SoViT,MobileNet-V5-300M 在量化后提升 13 倍(未量化提升 6.5 倍),参数量减少 46%,内存占用降低 4 倍。
生态系统与部署
Gemma 3n 得到众多开源工具和框架的支持,包括 Hugging Face Transformers、llama.cpp、Ollama、MLX、Google AI Edge 和 vLLM。部署选项涵盖 Google AI Studio、Vertex AI、NVIDIA API Catalog 以及 Cloud Run 等。