Gemma 4 在 vLLM 上:先進推理與多模態能力

vLLM 宣布即時支援 Gemma 4,Google 最先進的開放模型系列。此版本讓開發者能在廣泛的硬體後端上部署具備高參數智慧、先進推理與代理能力的模型,包括 Google TPU、AMD GPU 與 Intel XPU。

模型族群與架構

Gemma 4 採用與 Gemini 3 相同的研究與技術,並以商業寬容的 Apache 2.0 授權釋出。此族群包含四種不同規模的模型,針對不同硬體環境進行了調整:

  • Effective 2B (E2B): 為邊緣裝置設計。
  • Effective 4B (E4B): 為邊緣裝置設計。
  • 26B Mixture of Experts (MoE): 較大且高效的變體。
  • 31B Dense: 此族群中最大的密集模型。

核心技術能力

Gemma 4 在推理、模態與規模上帶來多項突破,以支援前沿研究與產品創新:

先進推理與代理工作流程

Gemma 4 為複雜的多步規劃而設計,並在數學與邏輯密集的指令遵循上提供顯著提升。為支援自主代理,模型原生支援:

  • Function-calling
  • Structured JSON output
  • System instructions

多模態處理

所有 Gemma 4 模型皆能原生處理具可變解析度的影像與影片,特別擅長 OCR 與圖表理解。此外,邊緣模型(E2B 與 E4B)內建音訊輸入,支援語音辨識。

上下文視窗與語言支援

模型透過擴展的上下文視窗支援大量資料集:邊緣模型為 128K,上限較大的變體可達 256K。此外,Gemma 4 原生以超過 140 種語言進行訓練,促進全球應用的開發。

程式碼生成

此系列提供高品質的離線程式碼支援,使標準工作站能夠建立本地優先的 AI 開發環境。

硬體相容性與部署

vLLM 為 Gemma 4 在多種硬體後端提供最佳化支援,以降低硬體負擔。支援的部署平台包括:

  • Nvidia GPUs
  • AMD GPUs
  • Intel XPUs
  • Google TPUs

支援範圍從筆記型電腦等級的硬體到資料中心加速器,並包含針對 Google Kubernetes (GKE) 與 Google Compute Engine (GCE) 使用 Trillium 與 Ironwood TPU 的特定整合。

Sources