Gemma 4 12B リリースノート / 新機能

Googleは、コンシューマー向けハードウェアにエージェント的な知能をもたらすために設計された中規模マルチモーダルモデル、Gemma 4 12Bをリリースしました。このモデルは、エッジに最適化されたE4Bと、より大規模な26B Mixture of Experts (MoE) モデルの間のパフォーマンスギャップを埋めるもので、、16GBのVRAMまたはユニファイドメモリを搭載したノートPCでローカル実行可能なほど小さなメモリフットプリントを維持しつつ、26Bモデルに迫る推論能力を提供します。

統合されたエンコーダーレス・アーキテクチャ

Gemma 4 12Bは、レイテンシとメモリオーバーヘッドを削減するために、従来のマルチモーダル・エンコーダーを排除しています。画像や音声を言語モデル用の表現に変換するために個別のモデルを使用する代わりに、入力はLLMバックボーンに直接流れます。

ネイティブな視覚処理

このモデルは、標準的なビジョン・エンコーダーを軽量な埋め込みモジュールに置き換えています。このモジュールは、単一の行列乗算、位置エンコーディング、および正規化で構成されており、LLMバックボーンが視覚処理を直接処理できるようにします。

ネイティブな音声処理

音声処理は、音声エンコーダーを完全に削除することで、さらに合理化されています。生の音声信号は、テキストトークンと同じ次元空間に直接投影され、モデルがオフラインで音声入力を文字起こし、フォーマット、および翻訳することを可能にします。

パフォーマンスとローカル展開

ハードウェア要件と効率性

Gemma 4 12Bはローカル実行に最適化されており、16GBのRAM/VRAMを必要とします。レイテンシをさらに低減するために、モデルにはMulti-Token Prediction (MTP) draftersが含まれています。

エコシステム・サポート

このモデルはApache 2.0ライセンスの下でリリースされ、いくつかの開発ツールに統合されています:

  • Inference Engines: llama.cpp, vLLM, SGLang, および MLX によってサポートされています。
  • Local Runners: LM Studio および Ollama を介して利用可能です。
  • Fine-tuning: Unsloth と互換性があります。
  • Deployment: Google Cloud (Cloud Run, GKE) および Gemini Enterprise Agent Platform Model Garden を通じて展開可能です。

開発者向けリソースとエージェント的ワークフロー

AIエージェントの作成を容易にするため、Googleは公式の Skills Repository をリリースしました。これは、エージェントがGemmaモデルを使用して構築できるように特別に設計されたスキルライブラリです。

コミュニティの洞察と技術的議論

リリースに関する開発者の議論では、いくつかの技術的な検討事項や批判が挙げられています:

  • アーキテクチャの明確化: 一部の開発者は「エンコーダーレス」という主張に疑問を呈しており、埋め込みモジュールは技術的にはエンコーディングの一種であるものの、SigLIPのような専用の別個のモデルを使用していないことを指摘しています。
  • Quantization: 16GBのVRAM要件が量子化の使用を前提としているかどうかについて議論が行われています。一部のユーザーは、量子化が品質の低下を招く可能性があると主張しています。
  • Market Positioning: 一部の観察者は、このモデルがGemma 4ラインナップにおける重要なギャップを埋めるものであると指摘しています。コンシューマー級のVRAMに収まりつつ、コンテキスト用のスペースを確保できる事前学習済みモデルを提供しています。
  • Utility vs. MoE: 一部のユーザーは、12Bモデルがニッチなリリースであると示唆しており、MoEモデルの方が、アクティブな重みが少ないため、速度とスコアの両面で12Bモデルを上回る可能性があると主張しています。そのため、12Bモデルは特にRAM制約のある環境で最も有用であるとしています。

Sources