DiffusionGemma: 透過文字擴散實現 4 倍更快的文字生成

DiffusionGemma: 透過文字擴散實現 4 倍更快的文字生成

Google DeepMind 已推出 DiffusionGemma,這是一個專為高速文字生成設計的實驗性開放模型。透過使用文字擴散方法同時生成整個文本塊來取代逐個標記的序列處理,該模型在專用 GPU 上可實現最高 4 倍更快的推理。

高速推理與硬體優化

DiffusionGemma 將解碼瓶頸從記憶體頻寬轉移到運算,使其在本地、低併發推理期間能更有效率地利用 GPU 硬體。與傳統自回歸模型相比,此方法可顯著提升標記輸出速度。

  • 效能基準: 該模型在單顆 NVIDIA H100 上可達到每秒 1000+ 個標記,在 NVIDIA GeForce RTX 5090 上可達到每秒 700+ 個標記。
  • 硬體占用: 作為一個在推理期間僅啟用 3.8B 參數的 26B Mixture of Experts (MoE) 模型,DiffusionGemma 在量化後可適應高端消費類 GPU 的 18GB VRAM 限制。
  • 企業與消費者支援: 該模型已針對 NVIDIA 硬體進行優化,包括使用 NVFP4 (4-bit 浮點) 內核的 Hopper 和 Blackwell 架構,以實現近乎無損精度的加速吞吐量。它與消費類 GPU 如 RTX 4090 和 5090 相容。

技術架構:文字擴散 vs. 自回歸生成

DiffusionGemma 離開了從左到右逐個標記生成的標準「打字機」方法。相反,它的運作方式類似於「印刷機」,同時草擬整個 256 標記的段落。

擴散過程

類似於圖像生成模型,DiffusionGemma 透過迭代細化過程生成文字:

  1. 畫布: 該過程從隨機佔位符標記的畫布開始。
  2. 迭代細化: 模型進行多次通過,鎖定正確的標記並將其作為上下文來細化剩餘的佔位符。
  3. 最終潤飾: 文字收斂為最終的高品質輸出。

雙向注意力與非線性生成

由於模型會並行生成 256 個標記,每個標記都可以關注所有其他標記。這種雙向注意力為標記依賴未來上下文的非線性任務提供了明顯的優勢,例如:

  • 行內編輯與程式碼填充。
  • 生成氨基酸序列或數學圖形。
  • 解決數獨謎題(自回歸模型通常在此任務上會掙扎)。

使用案例與生產權衡

雖然 DiffusionGemma 提供極速,但其在輸出品質與部署環境方面涉及特定的權衡。

品質 vs. 速度

DiffusionGemma 在最大輸出品質方面優先考慮速度與平行佈局生成。對於需要最高可能品質的應用,Google DeepMind 建議使用標準的 Gemma 4 模型。

本地 vs. 雲端部署

DiffusionGemma 專門針對本地、低併發推理進行優化。在高 QPS(每秒查詢數)雲端環境中,自回歸模型更有效率,因為它們可以批量處理數千個請求以飽和運算。在此種情況下,DiffusionGemma 的並行解碼收益遞減,並可能增加服務成本。

可用性與整合

DiffusionGemma 以 Apache 2.0 授權釋出,並可透過 Hugging Face 取得。它受到多種開發工具與框架的支援,包括:

  • 服務框架: MLX、vLLM(含 Red Hat 整合)以及 Hugging Face Transformers。
  • 微調工具: Hackable Diffusion(JAX 工具箱)、Unsloth 以及 NVIDIA NeMo。
  • 部署平台: Gemini Enterprise Agent Platform Model Garden 與 NVIDIA NIM。

Sources