Gemma 4 QAT リリース: エッジデバイス向けモデル圧縮の最適化

Googleは、Quantization-Aware Training (QAT) で最適化されたGemma 4の新しいチェックポイントをリリースしました。このアップデートは、標準的な圧縮に伴う大幅な品質低下を伴わずに、モバイルデバイス、ラップトップ、およびコンシューマー向けGPUでのローカル展開において、メモリ要件の削減と推論速度の向上に焦点を当てています。

Quantization-Aware Training (QAT) vs. Post-Training Quantization (PTQ)

QATは、トレーニング中に量子化をシミュレートすることで、量子化プロセスをトレーニングフェーズに直接統合します。このアプローチは、トレーニング完了後にモデルを圧縮する標準的なPost-Training Quantization (PTQ) と比較して、品質の低下を最小限に抑えます。Googleは、QATの結果が標準的なPTQベースラインよりも高い全体的な品質をもたらすと報告しています。

このリリースでは、主に2つの形式でQATチェックポイントを提供します:

  • Q4_0: すべてのGemma 4モデルのパフォーマンスを最大化するように設計された、広く使用されている量子化形式。
  • Mobile-Specialized Format: エッジハードウェア向けに特別に設計され、メモリフットプリントをさらに削減するための新しいスキーマ。

モバイル特化の最適化

モバイルプロセッサでのスムーズなパフォーマンスを確保するために、Googleはエッジハードウェアの特定の制約に対処するカスタム量子化スキーマを実装しました:

  • Static Activations: トレーニング中にスケーリング設定を事前計算することで、モデルはモバイルチップ上でのリアルタイム処理負荷を軽減し、より高速なレスポンスタイムを実現します。
  • Channel-wise Quantization: データはモバイルアクセラレータの設計に合わせるように構造化されており、低速なソフトウェアによる回避策なしにネイティブに計算を実行できます。
  • Targeted 2-bit Quantization: コアとなる推論レイヤーは高い精度を維持しますが、トークン生成を担当するモデルの特定のパーツは、ストレージを節約するために2-bitに大幅に圧縮されます。
  • Embedding and KV Cache Optimization: 圧縮は語彙リストと短期メモリ (KV cache) に重点を置いており、これにより長い会話中のアクティブなメモリフットプリントを劇的に削減します。

Gemma 4 E2Bモデルのテキストのみの展開(Per-Layer Embeddingsを除く)の場合、メモリ要件は1GB未満に削減されます。

展開とエコシステムサポート

QATチェックポイントは、Hugging Faceでllama.cpp用のGGUF形式、およびvLLM用の圧縮テンソルとして利用可能です。このリリースは、他にもいくつかの統合パスをサポートしています:

  • ローカルデスクトップ実行: llama.cpp、Ollama、およびLM Studioを介してサポート。
  • デバイス上での展開: GoogleのLiteRT-LMランタイム、またはTransformers.jsを介したウェブベースの実行により、エッジ展開に最適化。
  • 高パフォーマンス・サービング: SGLangおよびvLLMによってサポートされ、Apple Silicon向けにMLXを介した特定の最適化も提供。
  • ファインチューニング: 重みはHugging Face TransformersおよびUnslothを使用してファインチューニング可能です。

コミュニティの洞察と技術的観察

開発者のフィードバックは、これらの圧縮モデルの有用性と限界の両方を示しています:

パフォーマンスと精度

一部のユーザーは、サードパーティによる最適化が結果をさらに改善する可能性があると指摘しています。あるユーザーは、UnslothのQAT量子化モデルが、元のGoogle QATチェックポイントよりも、BF16の非量子化モデルに対して高い精度を維持しているように見えると報告しています:

"UnslothのQAT量子化モデルは、BF16の非量子化モデルと比較して、精度が100%に非常に近いレベルまで到達できるように見えます。また、Unslothの量子化モデルは、記事に掲載されているオリジナルのGoogle QATチェックポイントよりも優れています。"

VRAMとハードウェア互換性

Gemma 4 12BモデルのQ4_0バリアントは、約6.7GBのVRAMを必要とし、16GBのRAMを搭載したマシンで実行可能です。しかし、コミュニティメンバーは、GoogleのEdge Gallery for macOSにおいて、Q4_0バリアントの要件が低いにもかかわらず、12BモデルがRAM制約によりサポート対象外としてリストされているという不一致を指摘しました。

マルチモーダル機能

初期のテストでは、圧縮されたE2Bモデルはマルチモーダル・タスクを実行する能力を維持していることが示されています。あるユーザーは、Mac上でlitert-lmを使用してgemma-4-E2B-it-litert-lmモデル(約3.2GB)を正常に動作させることに成功し、音声や画像入力の扱い、さらを使用してSVGコードを生成することさえできることを実証しました。

Sources