bstnxbt/dflash-mlx
Lossless DFlash speculative decoding for MLX on Apple Silicon
解決的問題
dflash-mlx 實作了 DFlash,這是一種專為 Apple Silicon 設計的預測性解碼技術,旨在加速 LLM 推論。它透過使用小型草稿模型並行預測多個標記,再由更大的目標模型在單次前向傳播中進行驗證,從而解決自回歸生成的瓶頸,顯著提升每秒生成的標記數(tokens-per-second),同時保持輸出品質不變。
工作原理
該項目使用一個塊擴散草稿模型(通常約為 10 億參數)在一次前向傳播中生成 16 個標記。隨後,更大的目標模型對這些標記進行單次前向傳播驗證。如果目標模型與草稿模型一致,則接受這些標記;如果不一致,則在第一個錯誤處截斷草稿,並由目標模型提供正確的下一個標記。
針對 Apple Silicon 的關鍵技術優化包括:
- 磁帶重播回滾:記錄創新磁帶,以在驗證失敗時高效恢復 GatedDeltaNet 模型的狀態。
- 自訂 Metal 內核:包含專為 M 系列 GPU 優化的
verify_qmmint4 量化矩陣乘法內核,以加速驗證步驟。 - 分層前綴快取:採用兩級(RAM 和 SSD)快取系統,儲存目標模型狀態的快照,以跳過重複提示的預填入階段。
- 位置稀疏預填入:允許對目標模型選擇性地預填入部分標記,以減少計算量。
適用對象
希望在 Apple Silicon(M 系列晶片)上以顯著更高的生成速度運行大型語言模型(如 Qwen 和 Gemma)的開發者與研究人員。
主要亮點
- 無損加速:每個生成的標記都與目標模型進行驗證,確保輸出與目標模型的貪婪解碼完全一致。
- 高加速比:基準測試顯示,根據模型和提示長度不同,加速比在 1.3x 到 4.3x 之間。
- OpenAI 兼容伺服器:包含可與 aider、Continue 和 Open WebUI 等工具整合的伺服器。
- 架構支援:針對 Qwen3.5、Qwen3.6 和 Gemma4 模型進行優化。
- 整合診斷功能:提供詳細指標與結構化輸出,用於除錯與效能分析。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch