Gemma 4 12B 发布说明 / 更新内容

Google 发布了 Gemma 4 12B,这是一款中型多模态模型,旨在为消费级硬件带来智能体能力。该模型填补了针对边缘优化的 E4B 与更大的 26B Mixture of Experts (MoE) 模型之间的性能空白,在提供接近 26B 模型推理能力的同时,保持了足够小的内存占用,使其能够在配备 16GB VRAM 或统一内存的笔记本电脑上本地运行。

统一无编码器架构

Gemma 4 12B 取消了传统的多模态编码器,以降低延迟和内存开销。输入不再使用单独的模型将图像和音频转换为语言模型的表示形式,而是直接流入 LLM 主干网络。

原生视觉处理

该模型使用轻量级嵌入模块取代了标准视觉编码器。该模块由单个矩阵乘法、位置嵌入和归一化组成,允许 LLM 主干网络直接处理视觉处理任务。

原生音频处理

通过完全移除音频编码器,音频处理得到了进一步简化。原始音频信号被直接投影到与文本 token 的相同维度空间中,使模型能够离线进行语音输入转录、格式化和翻译。

性能与本地部署

硬件要求与效率

Gemma 4 12B 针对本地执行进行了优化,需要 16GB RAM/VRAM。为了进一步降低延迟,该模型包含了 Multi-Token Prediction (MTP) drafter。

生态系统支持

该模型基于 Apache 2.0 许可证发布,并已集成到多种开发工具中:

  • 推理引擎: 支持 llama.cpp, vLLM, SGLang, 和 MLX。
  • 本地运行器: 可通过 LM Studio 和 Ollama 使用。
  • 微调: 兼容 Unsloth。
  • 部署: 可通过 Google Cloud (Cloud Run, GKE) 和 Gemini Enterprise Agent Platform Model Garden 进行部署。

开发者资源与智能体工作流

为了促进 AI 智能体的创建,Google 发布了官方 Skills Repository,这是一个专门设计的技能库,旨在使智能体能够使用 Gemma 模型进行构建。

社区见解与技术讨论

关于此次发布的开发者讨论突出了几个技术考量和批评:

  • 架构澄清: 一些开发者对“无编码器”的说法提出了质疑,指出嵌入模块在技术上也是一种编码形式,尽管它没有像 SigLIP 那样拥有专门的独立模型。
  • 量化: 有关于 16GB VRAM 要求是否假设使用了量化技术的讨论,一些用户认为这可能会导致质量损失。
  • 市场定位: 一些观察者指出,该模型填补了 Gemma 4 系列中的关键空白,提供了一个预训练模型,既能舒适地适配消费级 VRAM,又为上下文窗口留出了空间。
  • 效用 vs. MoE: 一些用户认为 12B 模型是一个利基市场发布,理由是 MoE 模型由于活跃权重较低,在速度和评分方面可能表现更好,因此 12B 模型在内存受限的环境中最为有用。

Sources