Gemma 4 12B リリースノート / 新機能

Gemma 4 12B リリースノート / 新機能

Google DeepMindは、ローカルハードウェアにエージェント的インテリジェンスをもたらすように設計された中規模のマルチモーダルモデルであるGemma 4 12Bを発表しました。統合されたエンコーダーフリーアーキテクチャを利用することで、このモデルはより大きな26B Mixture of Experts (MoE)モデルに近いパフォーマンスを提供しながら、16GBのVRAMまたは統合メモリを搭載したコンシューマーラップトップで実行できるほど小さなメモリフットプリントを維持しています。

統合エンコーダーフリーアーキテクチャ

Gemma 4 12Bは、レイテンシとメモリ使用量を削減するために従来のマルチモーダルエンコーダを排除しています。言語モデルに渡す前に画像と音声を変換するために別々のエンコーダを使用する代わりに、ビジョンとオーディオの入力はLLMバックボーンに直接流れ込みます。

ネイティブビジョン処理

このモデルは、標準のビジョンエンコーダを軽量な埋め込みモジュールに置き換えます。このモジュールは、単一の行列乗算、位置埋め込み、および正規化から構成され、LLMバックボーンがビジョン処理を直接処理できるようにします。

ネイティブオーディオ処理

オーディオ処理は、オーディオエンコーダを完全に削除することでさらに簡素化されます。生のオーディオ信号は、テキストトークンと同じ次元空間に直接投影され、これによりモデルはオフラインで音声入力を文字起こし、フォーマット、翻訳することが可能になります。

パフォーマンスとエージェント機能

Gemma 4 12Bは、エッジフレンドリーなE4Bと26B MoEモデルの間の橋渡しとして位置付けられています。このモデルは、26Bモデルに近いベンチマークパフォーマンスを提供し、これによりローカルでのマルチステップ推論と複雑なエージェントワークフローを処理する能力が解放されます。

これらの機能をサポートするために、GoogleはエージェントがGemmaモデルで構築できるように特別に設計されたスキルのライブラリである公式Skills Repositoryをリリースしています。

デプロイとアクセシビリティ

Apache 2.0ライセンスの下でリリースされたGemma 4 12Bは、いくつかのチャネルを通じて開発者エコシステム全体で利用可能です:

  • Local Inference: LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent app、およびLiteRT-LM CLIを介してサポートされます。
  • Weights and Frameworks: 事前学習済みおよび指示チューニング済みチェックポイントはHugging FaceとKaggleで利用可能です。実装はHugging Face Transformers、llama.cpp、MLX、SGLang、およびvLLMを通じてサポートされます。
  • Fine-tuning: Unslothを介した効率的なファインチューニングが利用可能です。
  • Cloud Deployment: Google Cloudを介して本番エンドポイントをデプロイできます。これにはGemini Enterprise Agent Platform Model Garden、Cloud Run、およびGKEが含まれます。

レイテンシ最適化

推論レイテンシを削減するために、Gemma 4 12BはMulti-Token Prediction (MTP)ドラフターを備えており、これにより「drafter-ready」状態となり、より高速な応答生成が可能になります。

Sources