Gemma 3 发行说明 / 新功能

Google 发布了 Gemma 3,这是一代新的开放权重大型语言模型(LLM),引入了原生多模态、扩展的多语言支持以及显著更大的上下文窗口。模型家族包括四种规模——1B、4B、12B 和 27B 参数——提供预训练(基础)和指令调优(IT)两个版本。

核心能力和模型变体

Gemma 3 提供了一系列可扩展的模型,专为不同的部署环境设计,从设备端应用到高性能服务器。虽然 1B 模型仅限于文本,但 4B、12B 和 27B 变体是完全多模态的,能够处理图像和文本。

模型 预训练 指令调优 多模态 多语言 上下文窗口
1B gemma-3-1b-pt gemma-3-1b-it 英语 32K
4B gemma-3-4b-pt gemma-3-4b-it 140+ 语言 128K
12B gemma-3-12b-pt gemma-3-12b-it 140+ 语言 128K
27B gemma-3-27b-pt gemma-3-27b-it 140+ 语言 128K

技术增强

Gemma 3 相较于 Gemma 2 引入了三项主要的技术升级,以提升多功能性和效率。

上下文长度扩展

上下文窗口已从 Gemma 2 的 8k 增加到 4B、12B 和 27B 模型的 128k(而 1B 模型为 32k)。为了在不从头重新训练的情况下实现这一点,Google 采用了以下方法:

  • 位置嵌入调整:RoPE 基础频率从 10k 提升至 1M,并按因子 8 进行缩放。
  • KV 缓存优化:模型使用滑动窗口交错注意力。超参数经过调整,以在一个全局层之间交错五个局部层,并将窗口大小减少到 1024 个标记。

原生多模态

多模态功能由 SigLIP 图像编码器提供支持,该编码器处理被调整为 896x896 的正方形图像。为了在推理过程中处理非正方形宽高比和高分辨率图像,Gemma 3 采用了一种“pan and scan”算法,该算法自适应地裁剪图像以放大细节。

注意力机制根据输入类型而有所不同:

  • 文本:使用单向(因果)注意力。
  • 图像:使用完全双向注意力,使模型能够在不使用掩码的情况下分析图像的所有部分。

多语言支持

通过将预训练数据集中的多语言数据量翻倍,语言覆盖范围得到了扩展。模型使用了具有 262K 条目的 Gemini 2.0 SentencePiece 分词器,这特别提升了中文、日文和韩文的编码。

性能与评估

在 LMSys Chatbot Arena 的人类偏好评估中,Gemma 3 27B IT 模型获得了 Elo 分数 1339,位列前十名,整体上可与 o1-preview 相媲美。

基准性能对于 27B 模型包括:

  • 推理与数学:在 MATH 上得分 69.0,在 GPQA Diamond 上得分 42.4。
  • 多模态与事实:在 MMMU 上得分 64.9,在 FACTS Grounding 上得分 74.9。
  • 编码与 SQL:在 LiveCodeBench 上得分 29.7,在 Bird-SQL 上得分 54.4。
  • 通用知识:在 MMLU-Pro 上得分 67.5。

尽管与封闭的 Gemini 模型具有竞争力,但 27B 模型在基本事实方面表现出弱点,在 SimpleQA 上仅得 10.0 分。

部署与推理

Hugging Face Transformers

Gemma 3 通过两个主要类集成到 transformers 库中:

  • Gemma3ForConditionalGeneration:用于 4B、12B 和 27B 的视觉-语言模型。
  • Gemma3ForCausalLM:用于 1B 纯文本模型,或通过省略视觉塔将多模态模型作为纯文本 LLM 运行。

设备端和低资源选项

对于本地部署,Gemma 3 支持以下几种框架:

  • MLX:通过 mlx-vlm 在 Apple Silicon(Mac 和 iPhone)上提供零天支持。
  • Llama.cpp:提供预量化的 GGUF 文件,可在本地 CPU/GPU 上执行。
  • Hugging Face Endpoints:通过 Inference Catalog,为 12B 和 27B IT 模型提供一键部署。

Sources