z-lab/dflash

DFlash: Block Diffusion for Flash Speculative Decoding

解決的問題

DFlash 透過實作更高效的推測式解碼方法,解決大型語言模型(LLM)逐 token 生成速度緩慢的問題。它能實現高品質的並行草稿生成,減少目標模型產生回應所需時間。

工作原理

使用輕量級區塊擴散模型作為草稿模型。此草稿模型並行預測多個 token,而非逐一預測,隨後由目標 LLM 在單一走訪中進行驗證。系統支援多種後端,包括 Transformers、MLX(適用於 Apple Silicon)、以及 SGLang 和 vLLM 等相容 OpenAI 的伺服器。

適用對象

希望透過推測式解碼提升生成吞吐量並降低延遲的 LLM 推論開發者與研究人員。

主要亮點

  • 並行草稿生成:利用區塊擴散技術同時產生多個 token 候選。
  • 廣泛的模型支援:相容多種模型,包括 Qwen、Gemma、MiniMax、Kimi 與 Llama-3.1。
  • 彈性部署:可在不同硬體與軟體堆疊上運作,包括 Mac 上的本地 MLX 與伺服器端的 vLLM/SGLang。
  • 整合基準測試:內建工具,可用於在 GSM8K 與 HumanEval 等資料集上評估效能。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • 專案