Gemma 4 发布:开源多模态模型,支持本地设备
TL;DR
Gemma 4,Google DeepMind 的全新多模态系列,现已在 Hugging Face 以 Apache 2.0 许可证公开发布,提供图像、音频和视频理解,支持最高 256 K 上下文窗口,并可通过 transformers、llama.cpp、MLX、Rust 和 WebGPU 实现本地设备部署。
Gemma 4 有哪些新特性?
Gemma 4 为 Gemma 系列加入了真正的多模态能力(图像、音频、视频),支持可变宽高比的图像 token 预算,并提供五种模型规模——从 2.3 B 参数的边缘模型(E2B)到 31 B 密集模型——每种规模均提供 base 和指令微调检查点。所有模型均支持 128 k 或 256 k token 的上下文窗口,能够在本地设备上实现长篇推理和代理式使用场景。
| Model | 有效参数 | 上下文 | 检查点 |
|---|---|---|---|
| Gemma 4 E2B | 2.3 B(含嵌入为 5.1 B) | 128 k | base,指令微调 |
| Gemma 4 E4B | 4.5 B(含嵌入为 8 B) | 128 k | base,指令微调 |
| Gemma 4 12B Unified | 11.95 B dense(无编码器) | 256 k | base,指令微调 |
| Gemma 4 31B | 31 B dense | 256 k | base,指令微调 |
| Gemma 4 26B A4B (MoE) | 26 B 总量,4 B 活跃 | 256 k | base,指令微调 |
架构亮点
交替滑动窗口与全局注意力
较小的密集模型使用 512‑token 滑动窗口;较大的模型使用 1024‑token 窗口,并交替使用全上下文层,以保持计算线性同时保留长程依赖。
双重 RoPE 配置
标准的旋转位置嵌入(RoPE)驱动滑动层;一种裁剪的 RoPE 变体驱动全局层,在不增加额外内存的情况下扩展有效上下文。
每层嵌入 (PLE)
PLE 为每个 token 添加轻量级的每层条件向量。它将 token‑identity 查找与上下文感知投影相结合,使后续层能够接收 token‑specific 信号而不会给初始嵌入表带来负担。此机制以适度的参数成本提升专门化,并通过使用 pad token ID 支持多模态占位符。
共享 KV 缓存
最后 N 层复用同一注意力类型的前一非共享层的键值(KV)张量。此做法在推理期间显著降低计算和内存,尤其是长上下文生成时,质量损失可忽略不计。
视觉和音频编码器
- Vision encoder(除 12B 之外的所有模型)使用学习到的 2‑D 位置、多维 RoPE,并支持 70‑1120 token 的预算,保持原始宽高比。
- Audio encoder(E2B、E4B)采用与 Gemma‑3n 相同的 USM‑style conformer。
- Unified 12B 取消了独立的编码器;原始图像块和音频波形直接投射到 LLM 嵌入空间,简化了延迟和微调流程。
多模态能力
Gemma 4 能够开箱即用地处理 OCR、语音转文本、目标检测、指向以及多模态函数调用。模型遵循严格的输入顺序:先图像后文本,音频在文本之后。此约定是内置聊天模板所必需的。
示例:GUI 元素检测
Prompt: “图像中 "view recipe" 元素的边界框是什么?” 模型返回相对于 1000 × 1000 画布的 JSON 坐标,无需后处理。
示例:视频理解
Gemma 4 可以接受带可选音频提取的视频 URL。较小的模型(E2B/E4B)能够处理音频;较大的模型则处理仅视频流。示例输出展示了准确的场景描述和歌曲主题推断。
示例:音频问答与转录
使用相同的聊天模板,Gemma 4 能回答关于语音的详细问题或生成逐字转录。E4B 模型的转录在标点和大小写上与参考文本完全匹配。
示例:多模态函数调用
当被问及 “这张图中的城市是哪座?请查询那里的天气” 时,模型识别出城市为 Bangkok,并生成正确格式的工具调用 get_weather(city="Bangkok")。
任意地点部署
Gemma 4 随附对多种推理引擎的 Day‑0 支持,能够实现边缘设备和浏览器部署。
Transformers (Python)
pip install -U transformers
from transformers import pipeline
pipe = pipeline("any-to-any", model="google/gemma-4-e2b-it")
该 pipeline 接受混合模态消息,并可选 load_audio_from_video=True 以处理视频。
Llama.cpp (C++)
curl -LsSf https://llama.app/install.sh | sh
llama serve -hf ggml-org/gemma-4-E2B-it-GGUF
为所有尺寸提供 GGUF 检查点;量化方式可在服务时选择。
Transformers.js (浏览器)
Gemma 4 通过 transformers.js 在 WebGPU 上运行。演示空间直接在浏览器中展示图文和音文推理。
MLX (Apple Silicon)
mlx‑vlm 库提供 TurboQuant 4× 内存压缩,并支持在 M 系列芯片上进行长上下文推理。
Mistral.rs (Rust)
Mistral.rs 提供兼容 OpenAI 的服务器,内置工具调用和多模态支持。只需一条脚本即可安装并服务任意 Gemma 4 检查点。
多标记预测草稿器
Google 为所有 Gemma 4 尺寸发布了推测性草稿器。草稿器在一次前向传播中提出多个未来 token,目标模型进行验证,可实现约 3 倍加速且不损失质量。草稿器与主模型共享 KV 缓存,并对边缘变体使用嵌入聚类。
DiffusionGemma:通过扩散生成文本
DiffusionGemma(26B A4B)通过并行去噪 token 块而非逐 token 自回归生成文本。它在一次前向传播中产生 15–20 个 token,在 H100 FP8 上的低批量情况下实现超过 1100 tokens/s。准确率略有下降(例如 MMLU Pro 77.6 % 对比自回归 26B A4B 的 82.6 %),但吞吐量提升对延迟敏感的应用意义重大。
微调变得简单
TRL 集成
Gemma 4 可配合 trl 库进行监督微调,包括多模态工具响应训练。示例脚本在 CARLA 模拟器中训练模型驾驶,展示了视觉到动作的学习。
Vertex AI 支持
完整的 Vertex AI 示例展示了如何使用 CUDA 启动自定义容器,安装 Transformers 与 TRL,并在 H100 实例上微调 Gemma 4。
Unsloth Studio
Unsloth Studio 为本地或 Colab 微调提供 UI。用户可选择任意 Gemma 4 检查点,几次点击即可开始训练。
基准测试结果
Gemma 4 在推理、编码、视觉、音频和长上下文任务上建立了新的 Pareto 前沿。以下为指令微调模型的亮点:
| Benchmark | 31B | 26B A4B | 12B Unified | 4B E4B | 2.3B E2B |
|---|---|---|---|---|---|
| MMLU Pro | 85.2 % | 82.6 % | 77.2 % | 69.4 % | 60.0 % |
| AIME 2026 (no tools) | 89.2 % | 88.3 % | 77.5 % | 42.5 % | 37.5 % |
| GPQA Diamond | 84.3 % | 82.3 % | 78.8 % | 58.6 % | 43.4 % |
| LiveCodeBench v6 | 80.0 % | 77.1 % | 72.0 % | 52.0 % | 44.0 % |
| MMMU Pro (vision) | 76.9 % | 73.8 % | 69.1 % | 52.6 % | 44.2 % |
| MRCR v2 128k (long context) | 66.4 % | 44.1 % | 43.4 % | 25.4 % | 19.1 % |
31 B 密集模型的估计 LMArena 纯文本得分为 1452,而 26 B MoE 在仅 4 B 活跃参数的情况下达到 1441,展示了极致效率。
含义
- Open‑source frontier – 完全采用 Apache 2.0 许可证,Gemma 4 为社区提供了高质量的多模态模型,可在手机、笔记本和服务器上运行,无需许可障碍。
- On‑device agents – 长上下文、共享 KV 缓存和高效量化的组合,使 Gemma 4 成为本地助理、自治机器人和隐私保护应用的理想选择。
- Tool‑calling parity – 多模态函数调用的工作方式与纯文本调用相同,能够实现更丰富的代理工作流(例如视觉引导的天气查询)。
- Speed‑vs‑quality trade‑offs – DiffusionGemma 为生成密集型工作负载提供了全新的速度优先路径,而 MTP 草稿器在不牺牲答案质量的前提下加速标准 Gemma 4 推理。
立即尝试 Gemma 4
- Transformers demos – 为 E4B、12B Unified、26B A4B 和 31B 提供交互式空间。
- WebGPU demo – 通过
transformers.js在浏览器中运行 Gemma 4。 - Model hub – 所有检查点、GGUF 文件和 ONNX 导出均可在 https://huggingface.co/collections/google/gemma-4 获取。
致谢
此次发布得益于 Google DeepMind 的模型贡献以及 Hugging Face 社区的大量集成工作:Cyril、Raushan、Eustache、Arthur、Lysandre(transformers)、Joshua(transformers.js)、Eric(mistral.rs)、Son(llama.cpp)、Prince(MLX)、Quentin、Albert、Kashif(TRL)、Adarsh(SGLang)以及 Toshihiro(demo engineering)。