Gemma 4 在 vLLM 上:先進推理與多模態能力
vLLM 宣布即時支援 Gemma 4,Google 最先進的開放模型系列。此版本讓開發者能在廣泛的硬體後端上部署具備高參數智慧、先進推理與代理能力的模型,包括 Google TPU、AMD GPU 與 Intel XPU。
模型族群與架構
Gemma 4 採用與 Gemini 3 相同的研究與技術,並以商業寬容的 Apache 2.0 授權釋出。此族群包含四種不同規模的模型,針對不同硬體環境進行了調整:
- Effective 2B (E2B): 為邊緣裝置設計。
- Effective 4B (E4B): 為邊緣裝置設計。
- 26B Mixture of Experts (MoE): 較大且高效的變體。
- 31B Dense: 此族群中最大的密集模型。
核心技術能力
Gemma 4 在推理、模態與規模上帶來多項突破,以支援前沿研究與產品創新:
先進推理與代理工作流程
Gemma 4 為複雜的多步規劃而設計,並在數學與邏輯密集的指令遵循上提供顯著提升。為支援自主代理,模型原生支援:
- Function-calling
- Structured JSON output
- System instructions
多模態處理
所有 Gemma 4 模型皆能原生處理具可變解析度的影像與影片,特別擅長 OCR 與圖表理解。此外,邊緣模型(E2B 與 E4B)內建音訊輸入,支援語音辨識。
上下文視窗與語言支援
模型透過擴展的上下文視窗支援大量資料集:邊緣模型為 128K,上限較大的變體可達 256K。此外,Gemma 4 原生以超過 140 種語言進行訓練,促進全球應用的開發。
程式碼生成
此系列提供高品質的離線程式碼支援,使標準工作站能夠建立本地優先的 AI 開發環境。
硬體相容性與部署
vLLM 為 Gemma 4 在多種硬體後端提供最佳化支援,以降低硬體負擔。支援的部署平台包括:
- Nvidia GPUs
- AMD GPUs
- Intel XPUs
- Google TPUs
支援範圍從筆記型電腦等級的硬體到資料中心加速器,並包含針對 Google Kubernetes (GKE) 與 Google Compute Engine (GCE) 使用 Trillium 與 Ironwood TPU 的特定整合。