DiffusionGemma 技術報告

DiffusionGemma 是一款實驗性的開放權重語言模型,旨在消除傳統自回歸 (AR) 模型的序列解碼瓶頸。透過使用離散擴散 (discrete diffusion) 來迭代地並行精煉每組 256 個 token 的區塊,DiffusionGemma 在單張 NVIDIA H100 GPU 上實現了約每秒 1,500 個輸出 token 的生成速度,其表現顯著優於最先進的投機解碼 (speculative decoding)。

架構與訓練流程

DiffusionGemma 並非從零開始訓練。相反地,它是衍生自混合專家 (MoE) 的 Gemma 4 模型,該模型具有 3.8B 個激活參數與 25.2B 個總參數。從僅解碼器 (decoder-only) 的 AR 模型轉換為去噪器 (denoiser) 的過程,是透過利用所有 token 的 logits 來實現的,這是一項現有的 AR 模型具備但通常在標準生成過程中並不使用的能力。

訓練過程採用了計算效率極高的兩階段流程,僅需原 AR 模型總訓練 token 預算量的 10% 以下:

  1. 監督式微調 (SFT): 第一階段教導模型進行雙向去噪。

  2. 強化學習 (RL) 與採樣器蒸餾 (Sampler Distillation): 第二階段將 RL 與採樣器蒸餾結合,以同時提升生成品質與整體的推理效率。

性能與能力

DiffusionGemma 在生成速度與模型能力之間的權衡中,實現了新的 Pareto 前沿 (Pareto frontier)。平均而言,它在每次前向傳播 (forward pass) 中生成約 20 個 token,這使得在 H100 GPU 上能達到每秒 1,500 個 token 的吞吐量。

儘管轉向了基於擴散的解碼方式,該模型仍保留了基礎 Gemma 4 模型的核心能力,包括:

  • 思考模式 (Thinking mode): 支援內部推理過程。
  • 多模態輸入 (Multimodal inputs): 處理多種輸入類型的能力。
  • 長上下文 (Longe contexts): 支援擴展的上下文窗口。

此外,該模型仍具備自回歸生成的能力,且僅有輕微的性能下降,這表明了通往混合擴散-AR 解碼系統的潛在路徑。

社群洞察與實作

社群討論強調了這種方法有潛力應用於其他開放權重模型,以建立現有本地 LLM 的高速擴散版本。

硬體優化

在本地硬體上實作該模型的用戶已在 Apple Silicon 上取得了成功。一位開發者指出,由於擴散解碼是計算密集型 (computation-bound) 而非記憶體頻寬受限型 (memory-bandwidth bound),因此它特別適合於具有高計算能力但記憶體頻寬有限的設備。

"I've got it up to ~15tok/s on M3-class machines... DiffusionGemma with the right drafter can hit 20-30 tok/s on my machine."

對軟體開發的影響

一些分析師指出,如果擴散模型在程式碼生成方面達到高熟練度,極高的生成速度 (1,500 tokens/sec) 將會把軟體開發的瓶頸從模型生成轉移到 CPU 執行時間。這可能會導致人們重新思考如何設計編譯器、測試套件執行器以及開發工具鏈,以便在 LLM 提出建議的同時,讓編譯與單元測試在並行運作中重疊。

泛化潛力

社群對於這種方法是否能應用於其他模型(例如 Qwen),以大幅提升使用消費級 GPU 用戶的本地推理速度,展現出了極大的興趣。

Sources

相關