Gemma 3 版本說明 / 新功能

Google 已發布 Gemma 3,這是一種新一代的開放權重大型語言模型(LLM),引入了原生多模態、擴充的多語言支援以及顯著增加的上下文視窗。模型家族包含四種規模—1B、4B、12B 和 27B 參數—同時提供預訓練(基礎)和指令調整(IT)版本。

核心功能與模型變體

Gemma 3 提供一系列可擴充的模型,專為不同的部署環境設計,從設備端應用到高效能伺服器。雖然 1B 模型僅限於文字處理,但 4B、12B 和 27B 變體為完全多模態,能夠同時處理圖像與文字。

模型 預訓練 指令調整 多模態 多語言 上下文視窗
1B gemma-3-1b-pt gemma-3-1b-it 英語 32K
4B gemma-3-4b-pt gemma-3-4b-it 140+ 語言 128K
12B gemma-3-12b-pt gemma-3-12b-it 140+ 語言 128K
27B gemma-3-27b-pt gemma-3-27b-it 140+ 語言 128K

技術增強

Gemma 3 引入了三項主要的技術升級,相較於 Gemma 2,以提升多樣性與效率。

擴充上下文長度

上下文視窗已從 Gemma 2 的 8k 增加到 4B、12B 和 27B 模型的 128k(而 1B 模型為 32k)。為了在不從頭重新訓練的情況下達成此目標,Google 使用了以下方法:

  • 位置嵌入調整:RoPE 基礎頻率已從 10k 提升至 1M,並按 8 倍因數進行縮放。
  • KV 快取最佳化:模型使用滑動窗口交錯注意力。超參數已調整為交錯五層局部層與一層全局層,並將窗口大小減少至 1024 個 token。

原生多模態

多模態功能由 SigLIP 圖像編碼器提供動力,該編碼器處理被調整為 896x896 的正方形圖像。在推理期間,為了處理非正方形的長寬比和高解析度圖像,Gemma 3 採用「平移與掃描」演算法,自適應裁剪圖像以聚焦細節。

注意力機制根據輸入類型而有所不同:

  • 文字:使用單向(因果)注意力。
  • 圖像:使用完整雙向注意力,使模型能夠在不使用遮罩的情況下分析圖像的所有部分。

多語言支援

語言覆蓋範圍透過將預訓練資料集中的多語言資料量加倍來擴充。模型使用具有 262K 個條目的 Gemini 2.0 SentencePiece 分詞器,這特別提升了中文、日文和韓文的編碼。

效能與評估

在 LMSys Chatbot Arena 的人類偏好評估中,Gemma 3 27B IT 模型獲得了 1339 的 Elo 分數,排名整體前 10 名,並與 o1-preview 相當。

27B 模型的基準效能包括:

  • 推理與數學:在 MATH 上為 69.0,在 GPQA Diamond 上為 42.4。
  • 多模態與事實:在 MMMU 上為 64.9,在 FACTS Grounding 上為 74.9。
  • 編碼與 SQL:在 LiveCodeBench 上為 29.7,在 Bird-SQL 上為 54.4。
  • 一般知識:在 MMLU-Pro 上為 67.5。

雖然與封閉的 Gemini 模型具有競爭力,但 27B 模型在基本事實上顯示出弱點,在 SimpleQA 上僅得 10.0 分。

部署與推理

Hugging Face Transformers

Gemma 3 透過兩個主要類別整合到 transformers 庫中:

  • Gemma3ForConditionalGeneration:用於 4B、12B 和 27B 的視覺-語言模型。
  • Gemma3ForCausalLM:用於 1B 僅文字模型,或透過省略視覺塔將多模態模型作為僅文字的 LLM 運行。

設備端與低資源選項

針對本地部署,Gemma 3 支援以下幾種框架:

  • MLX:透過 mlx-vlm 提供對 Apple Silicon(Mac 與 iPhone)的零日支援。
  • Llama.cpp:提供預先量化的 GGUF 檔案,可在本地 CPU/GPU 上執行。
  • Hugging Face Endpoints:透過 Inference Catalog,為 12B 和 27B IT 模型提供一鍵部署。

Sources