Gemma 4 发布说明:用于推理和代理的高智能开源模型

Google DeepMind 推出了 Gemma 4,这是一系列专为高级推理和代理工作流打造的开源模型。这些模型旨在实现每参数的高智能,使开发者能够在从移动设备到专业工作站的广泛硬件上实现前沿水平的能力。

模型变体与性能

Gemma 4 以四种不同规模发布,以在原始智能与硬件效率之间取得平衡:

  • 31B Dense: 旨在提供最高质量,并作为微调的基础。它目前在 Arena AI 文本排行榜上全球排名第 #3 的开源模型。
  • 26B Mixture of Experts (MoE): 为低延迟优化,推理时仅激活 38 亿参数。它在 Arena AI 文本排行榜上排名第 #6。
  • Effective 4B (E4B): 一款面向边缘的优化模型,优先考虑多模态能力和移动及物联网设备的低延迟处理。
  • Effective 2B (E2B): 一款高效的边缘模型,旨在在手机和 Raspberry Pi 等设备上实现最小的内存和电池消耗。

关键技术能力

Gemma 4 引入了多项架构和功能改进,以支持复杂的 AI 应用:

高级推理与代理工作流

这些模型能够进行多步骤规划和深度逻辑推理,在数学和指令遵循基准测试中表现出显著提升。为支持自主代理,Gemma 4 原生支持函数调用、结构化 JSON 输出以及系统指令。

多模态处理

所有 Gemma 4 模型均原生支持视频和图像处理,支持可变分辨率以及 OCR、图表理解等任务。E2B 和 E4B 边缘模型进一步原生支持音频输入,用于语音识别和理解。

上下文窗口与语言支持

更大的 26B 和 31B 模型提供高达 256K token 的上下文窗口,而边缘模型(E2B 和 E4B)则拥有 128K token 的上下文窗口。该系列模型原生在超过 140 种语言上进行训练。

代码生成

Gemma 4 支持高质量的离线代码生成,使本地优先的 AI 编码助手成为可能。

硬件优化与部署

个人电脑与工作站

26B 和 31B 模型的未量化 bfloat16 权重可装入单块 80GB NVIDIA H100 GPU。量化版本可用于消费级 GPU,以支持本地 IDE 和代理工作流。

移动与物联网边缘设备

E2B 和 E4B 模型经过设计,以实现最大内存效率,可在 Android 设备、Raspberry Pi 和 NVIDIA Jetson Orin Nano 上离线运行,延迟接近零。Android 开发者可通过 AICore Developer Preview 对接 Gemini Nano 4 来原型化这些流程。

许可与生态系统

Apache 2.0 许可证

Gemma 4 在商业宽松的 Apache 2.0 许可证下发布,为开发者提供对其数据、基础设施和模型的完整控制权。

集成与工具

Gemma 4 在发布首日即支持广泛的平台和工具,包括:

  • 模型中心: Hugging Face、Kaggle 和 Ollama。
  • 框架: Transformers、TRL、vLLM、llama.cpp、MLX 和 Keras。
  • 部署: Google AI Studio、Vertex AI、Cloud Run、GKE 和 NVIDIA NIM。
  • 硬件: NVIDIA(Jetson Orin Nano 到 Blackwell GPU)、AMD(通过 ROCm 堆栈)以及 Google TPU(Trillium 和 Ironwood)。

“在 Apache 2.0 许可证下发布 Gemma 4 是一个重要的里程碑。我们对在 Hugging Face 上首日即支持 Gemma 4 系列感到非常兴奋。”

— Clément Delangue, co-founder and CEO, Hugging Face

Sources