Gemma 4 QAT 發佈:針對邊緣裝置優化模型壓縮
Google 已發佈針對 Gemma 4 進行量化感知訓練 (Quantization-Aware Training, QAT) 優化的全新權重檢查點 (checkpoints)。此次更新專注於降低記憶體需求,並在行動裝置、筆記型電腦和消費級 GPU 上進行本地部署時提高推論速度,且不會像標準壓縮技術那樣造成顯著的品質損失。
量化感知訓練 (QAT) 與 事後訓練量化 (PTQ) 的比較
QAT 透過在訓練期間模擬量化過程,將量化程序直接整合到訓練階段中。與在訓練完成後才進行壓縮的標準事後訓練量化 (Post-Training Quantization, PTQ) 相比,這種方法能將品質損失降至最低。Google 表示,QAT 的結果比標準 PTQ 基準線具有更高的整體品質。
此版本提供了兩種主要的 QAT 檢查點格式:
- Q4_0: 一種廣泛使用的量化格式,旨在最大化所有 Gemma 4 模型在各平台上的效能。
- 行動裝置專用格式: 一種專為邊緣硬體設計的新型架構,旨在進一步減少記憶體占用。
行動裝置專用優化
為了確保在行動處理器上的流暢表現,Google 實施了自定義的量化架構,以應對邊緣硬體的特定限制:
- 靜態激活值 (Static Activations): 透過在訓練期間預先計算縮放設定,模型能減少行動晶片上的即時處理負載,從而實現更快的響應時間。
- 通道量化 (Channel-wise Quantization): 數據結構經過調整以符合行動加速器的設計,使計算能夠以原生方式執行,而無需緩慢的軟體替代方案。
- 針對性 2-bit 量化: 核心推理層保持較高的精度,而負責生成 token 的特定部分則被大幅壓縮至 2-bit 以節省儲存空間。
- 嵌入與 KV 快取優化 (Embedding and KV Cache Optimization): 壓縮重點放在詞彙表和短期記憶 (KV cache),這能大幅減少長對話期間的活動記憶體占用。
對於僅限文本的 Gemma 4 E2B 模型部署(不含 Per-Layer Embeddings),記憶體需求已降低至 1 GB 以下。
部署與生態系統支援
QAT 檢查點可在 Hugging Face 上取得,提供適用於 llama.cpp 的 GGUF 格式,以及適用於 vLLM 的壓縮張量 (tensors)。此外,此版本也支援多種其他整合路徑:
- 本地桌面執行: 透過
llama.cpp、Ollama 和 LM Studio 支援。 - 行動裝置部署: 透過 Google 的
LiteRT-LM執行環境或透過Transformers.js進行網頁端執行,針對邊緣部署進行了優化。 - 高效能伺服器端: 透過
SGLang和vLLM支援,並針對 Apple Silicon 透過MLX進行了特定優化。 - 微調 (Fine-tuning): 權重可使用 Hugging Face Transformers 和 Unsloth 進行微調。
社群洞察與技術觀察
開發者回饋強調了這些壓縮模型既有的實用價值與限制:
效能與準確度
部分使用者指出,第三方優化可能會進一步提升結果。一位使用者回報,Unsloth 的 QAT 量化版本在相對於 BF16 未量化模型時,其準確度似乎比 Google 原生的 QAT 檢查點維持得更高:
"Looks like they can get very close to 100% accuracy compared to the BF16 model that is unquantized, and Unsloth's quants are better than the original Google's QAT as posted in the article."
VRAM 與硬體相容性
Gemma 4 12B 模型的 Q4_0 版本大約需要 6.7GB 的 VRAM,這使得它在配備 16GB RAM 的機器上運行是可行的。然而,社群成員指出 Google 的 Edge Gallery (macOS 版) 中存在差異,該處將 12B 模型列為不支援,儘管 Q4_0 版本的需求較低。
多模態能力
早期測試顯示,壓縮後的 E2B 模型仍具備多模態任務的能力。一位使用者回報,在 Mac 上使用 litert-lm 成功運行了 gemma-4-E2B-it-litert-lm 模型(約 3.2GB),展示了其處理音訊與圖像輸入,甚至能生成有效的 SVG 代碼的能力。