Gemma 3 版本說明 / 新功能
Google 已發布 Gemma 3,這是一種新一代的開放權重大型語言模型(LLM),引入了原生多模態、擴充的多語言支援以及顯著增加的上下文視窗。模型家族包含四種規模—1B、4B、12B 和 27B 參數—同時提供預訓練(基礎)和指令調整(IT)版本。
核心功能與模型變體
Gemma 3 提供一系列可擴充的模型,專為不同的部署環境設計,從設備端應用到高效能伺服器。雖然 1B 模型僅限於文字處理,但 4B、12B 和 27B 變體為完全多模態,能夠同時處理圖像與文字。
| 模型 | 預訓練 | 指令調整 | 多模態 | 多語言 | 上下文視窗 |
|---|---|---|---|---|---|
| 1B | gemma-3-1b-pt |
gemma-3-1b-it |
否 | 英語 | 32K |
| 4B | gemma-3-4b-pt |
gemma-3-4b-it |
是 | 140+ 語言 | 128K |
| 12B | gemma-3-12b-pt |
gemma-3-12b-it |
是 | 140+ 語言 | 128K |
| 27B | gemma-3-27b-pt |
gemma-3-27b-it |
是 | 140+ 語言 | 128K |
技術增強
Gemma 3 引入了三項主要的技術升級,相較於 Gemma 2,以提升多樣性與效率。
擴充上下文長度
上下文視窗已從 Gemma 2 的 8k 增加到 4B、12B 和 27B 模型的 128k(而 1B 模型為 32k)。為了在不從頭重新訓練的情況下達成此目標,Google 使用了以下方法:
- 位置嵌入調整:RoPE 基礎頻率已從 10k 提升至 1M,並按 8 倍因數進行縮放。
- KV 快取最佳化:模型使用滑動窗口交錯注意力。超參數已調整為交錯五層局部層與一層全局層,並將窗口大小減少至 1024 個 token。
原生多模態
多模態功能由 SigLIP 圖像編碼器提供動力,該編碼器處理被調整為 896x896 的正方形圖像。在推理期間,為了處理非正方形的長寬比和高解析度圖像,Gemma 3 採用「平移與掃描」演算法,自適應裁剪圖像以聚焦細節。
注意力機制根據輸入類型而有所不同:
- 文字:使用單向(因果)注意力。
- 圖像:使用完整雙向注意力,使模型能夠在不使用遮罩的情況下分析圖像的所有部分。
多語言支援
語言覆蓋範圍透過將預訓練資料集中的多語言資料量加倍來擴充。模型使用具有 262K 個條目的 Gemini 2.0 SentencePiece 分詞器,這特別提升了中文、日文和韓文的編碼。
效能與評估
在 LMSys Chatbot Arena 的人類偏好評估中,Gemma 3 27B IT 模型獲得了 1339 的 Elo 分數,排名整體前 10 名,並與 o1-preview 相當。
27B 模型的基準效能包括:
- 推理與數學:在 MATH 上為 69.0,在 GPQA Diamond 上為 42.4。
- 多模態與事實:在 MMMU 上為 64.9,在 FACTS Grounding 上為 74.9。
- 編碼與 SQL:在 LiveCodeBench 上為 29.7,在 Bird-SQL 上為 54.4。
- 一般知識:在 MMLU-Pro 上為 67.5。
雖然與封閉的 Gemini 模型具有競爭力,但 27B 模型在基本事實上顯示出弱點,在 SimpleQA 上僅得 10.0 分。
部署與推理
Hugging Face Transformers
Gemma 3 透過兩個主要類別整合到 transformers 庫中:
Gemma3ForConditionalGeneration:用於 4B、12B 和 27B 的視覺-語言模型。Gemma3ForCausalLM:用於 1B 僅文字模型,或透過省略視覺塔將多模態模型作為僅文字的 LLM 運行。
設備端與低資源選項
針對本地部署,Gemma 3 支援以下幾種框架:
- MLX:透過
mlx-vlm提供對 Apple Silicon(Mac 與 iPhone)的零日支援。 - Llama.cpp:提供預先量化的 GGUF 檔案,可在本地 CPU/GPU 上執行。
- Hugging Face Endpoints:透過 Inference Catalog,為 12B 和 27B IT 模型提供一鍵部署。