Gemma 4 在 vLLM 上:高级推理和多模态能力

vLLM 宣布立即支持 Gemma 4,谷歌最先进的开放模型系列。此发布使开发者能够在包括 Google TPU、AMD GPU 和 Intel XPU 在内的广泛硬件后端上部署具备高级推理和代理能力的高参数智能模型。

模型系列与架构

Gemma 4 基于与 Gemini 3 相同的研究和技术构建,并在商业宽松的 Apache 2.0 许可证下发布。该系列包括四种针对不同硬件环境量身定制的模型规模:

  • Effective 2B (E2B): 为边缘设备设计。
  • Effective 4B (E4B): 为边缘设备设计。
  • 26B Mixture of Experts (MoE): 更大且高效的变体。
  • 31B Dense: 系列中最大的密集模型。

核心技术能力

Gemma 4 在推理、模态和规模方面引入了多项突破,以支持前沿研究和产品创新:

高级推理和代理工作流

Gemma 4 为复杂的多步骤规划而设计,并在数学和逻辑密集的指令遵循方面提供了显著提升。为支持自主代理,模型原生支持:

  • 函数调用
  • 结构化 JSON 输出
  • 系统指令

多模态处理

所有 Gemma 4 模型均可原生处理可变分辨率的图像和视频,尤其擅长 OCR 和图表理解。此外,边缘模型(E2B 和 E4B)还支持原生音频输入用于语音识别。

上下文窗口和语言支持

模型通过扩展的上下文窗口支持大规模数据集:边缘模型为 128K,较大变体最高可达 256K。此外,Gemma 4 在超过 140 种语言上进行原生训练,促进全球化应用的开发。

代码生成

该系列提供高质量的离线代码支持,使标准工作站上的本地优先 AI 开发环境成为可能。

硬件兼容性与部署

vLLM 为 Gemma 4 在多种硬件后端上提供了优化支持,以降低硬件开销。支持的部署平台包括:

  • Nvidia GPU
  • AMD GPU
  • Intel XPU
  • Google TPU

支持范围从笔记本级硬件到数据中心加速器,包括使用 Trillium 和 Ironwood TPU 的 Google Kubernetes (GKE) 与 Google Compute Engine (GCE) 的特定集成。

Sources