z-lab/dflash
DFlash: Block Diffusion for Flash Speculative Decoding
解決的問題
DFlash 透過實作更高效的推測式解碼方法,解決大型語言模型(LLM)逐 token 生成速度緩慢的問題。它能實現高品質的並行草稿生成,減少目標模型產生回應所需時間。
工作原理
使用輕量級區塊擴散模型作為草稿模型。此草稿模型並行預測多個 token,而非逐一預測,隨後由目標 LLM 在單一走訪中進行驗證。系統支援多種後端,包括 Transformers、MLX(適用於 Apple Silicon)、以及 SGLang 和 vLLM 等相容 OpenAI 的伺服器。
適用對象
希望透過推測式解碼提升生成吞吐量並降低延遲的 LLM 推論開發者與研究人員。
主要亮點
- 並行草稿生成:利用區塊擴散技術同時產生多個 token 候選。
- 廣泛的模型支援:相容多種模型,包括 Qwen、Gemma、MiniMax、Kimi 與 Llama-3.1。
- 彈性部署:可在不同硬體與軟體堆疊上運作,包括 Mac 上的本地 MLX 與伺服器端的 vLLM/SGLang。
- 整合基準測試:內建工具,可用於在 GSM8K 與 HumanEval 等資料集上評估效能。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- 專案