Gemma 3n 发布说明 / 新功能

Google DeepMind 已发布 Gemma 3n,这是一款面向移动端的多模态模型系列,旨在将前沿级别的能力带到边缘设备。此次发布引入了嵌套 Transformer 架构,使模型的内存占用远小于其原始参数量,从而在仅有 2GB RAM 的硬件上实现高性能多模态 AI。

多模态能力与性能

Gemma 3n 原生支持图像、音频、视频和文本输入,并输出文本。它提供两种主要规模,基于有效参数量:E2BE4B。虽然原始参数量分别为 5B 和 8B,但架构优化使它们的内存占用分别为 2GB(E2B)和 3GB(E4B)。

关键性能里程碑包括:

  • LMArena 分数: E4B 版本是首个参数量低于 100 亿且 LMArena 分数超过 1300 的模型。
  • 多语言能力: 这些模型支持 140 种语言的文本以及 35 种语言的多模态理解。
  • 整体改进: 推理、编码和数学等方面的质量得到提升。

MatFormer:弹性推理架构

Gemma 3n 基于 MatFormer(Matryoshka Transformer)架构构建,该架构利用嵌套的 Transformer 实现弹性推理。在此设计中,较大的模型包含其更小且功能完整的版本。

开发者可以通过两种方式使用该架构:

  1. 预提取模型: 用户可以下载独立的 E2B 子模型,其推理速度比 E4B 模型快约 2 倍。
  2. 混搭定制: 使用 MatFormer Lab 工具,开发者可以通过调整每层前馈网络的隐藏维度(范围 8192 至 16384)并有选择地跳过层,创建介于 E2BE4B 之间的自定义规模模型。

虽然在当前发布中尚未实现,但该架构为未来的“弹性执行”奠定基础,使单一部署模型能够根据设备负载和任务需求,在 E4BE2B 推理路径之间动态切换。

内存与处理优化

每层嵌入 (PLE)

每层嵌入(PLE)通过让模型的大量参数——尤其是每层关联的嵌入——在 CPU 上计算,从而提升内存效率。这确保只有核心 Transformer 权重(E2B 大约 2B,E4B 大约 4B)占用受限的加速器内存(VRAM)。

KV 缓存共享

为加速音频和视频流中长序列的处理,Gemma 3n 实现了 KV 缓存共享。通过将局部和全局注意力中间层的键和值共享给所有顶层,模型在预填充性能上比 Gemma 3 4B 提升约 2 倍,缩短了流式应用的首 token 响应时间。

专用多模态编码器

音频理解

Gemma 3n 集成了基于通用语音模型(USM)的音频编码器,每 160ms 音频生成一个 token。这实现了设备端的自动语音识别(ASR)和自动语音翻译(AST),在英-西、英-法、英-意、英-葡等语言对的翻译上表现尤为出色。

MobileNet-V5 视觉编码器

模型使用了针对边缘设备优化的 MobileNet-V5-300M 视觉编码器。关键特性包括:

  • 吞吐量: 在 Google Pixel 上可实现最高 60 帧/秒的处理。
  • 灵活性: 支持 256x256、512x512 和 768x768 像素的输入分辨率。
  • 效率: 相较于 Gemma 3 中的基线 SoViT,MobileNet-V5-300M 在量化后提升 13 倍(未量化提升 6.5 倍),参数量减少 46%,内存占用降低 4 倍。

生态系统与部署

Gemma 3n 得到众多开源工具和框架的支持,包括 Hugging Face Transformers、llama.cpp、Ollama、MLX、Google AI Edge 和 vLLM。部署选项涵盖 Google AI Studio、Vertex AI、NVIDIA API Catalog 以及 Cloud Run 等。

Sources