Gemma 4 12B 发行说明 / 新功能
Gemma 4 12B 发行说明 / 新功能
Google DeepMind 推出了 Gemma 4 12B,这是一个中等规模的多模态模型,旨在将代理智能带到本地硬件。通过使用统一的、无编码器的架构,该模型提供了接近其更大的 26B 专家混合(MoE)对应模型的性能,同时保持了足够小的内存占用,能够在配备 16GB VRAM 或统一内存的消费者笔记本电脑上运行。
统一无编码器架构
Gemma 4 12B 消除了传统的多模态编码器,以降低延迟和内存使用。它不再使用单独的编码器在将图像和音频传递给语言模型之前进行翻译,而是让视觉和音频输入直接流入 LLM 骨干。
原生视觉处理
该模型用一个轻量级嵌入模块替换了标准的视觉编码器。该模块由单个矩阵乘法、位置嵌入和归一化组成,使得 LLM 骨干能够直接处理视觉信息。
原生音频处理
音频处理通过完全移除音频编码器而进一步简化。原始音频信号被直接投射到与文本令牌相同的维度空间,使得模型能够离线转录、格式化和翻译语音输入。
性能和代理能力
Gemma 4 12B 被定位为连接边缘友好的 E4B 和 26B MoE 模型之间的桥梁。它提供了接近 26B 模型的基准性能,这使得能够在本地处理多步推理和复杂的代理工作流。
为了支持这些能力,Google 正在发布一个官方的 Skills Repository,这是一个专门设计的技能库,以使代理能够使用 Gemma 模型进行构建。
部署和可访问性
在 Apache 2.0 许可证下发布,Gemma 4 12B 通过以下几种渠道在开发生态系统中可访问:
- 本地推理: 通过 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent app 和 LiteRT-LM CLI 支持。
- 权重和框架: 预训练和指令调优的检查点在 Hugging Face 和 Kaggle 上可用。实现通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 支持。
- 微调: 通过 Unsloth 提供高效的微调。
- 云部署: 可以通过 Google Cloud 部署生产端点,包括 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE。
延迟优化
为了降低推理延迟,Gemma 4 12B 配备了 Multi-Token Prediction (MTP) drafters,使其成为“drafter-ready”,以实现更快的响应生成。