ARahim3/mlx-dspark
Up to 4× faster LLM decoding on Apple Silicon, lossless. Native MLX port of DeepSeek's DSpark & z-lab's DFlash speculative decoding — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
What it solves
mlx-dspark 是一個針對 Apple Silicon 的高效能推論引擎,它實作了投機解碼(speculative decoding)來加速大型語言模型(LLM)的生成速度。它透過使用「drafters」(較小、較快的模型)來一次預測多個 token,然後由主目標模型在單次傳遞中進行驗證,從而消除了緩慢的逐個 token 生成的過程。這個過程是無損的,這意味著最終輸出與單獨執行目標模型完全相同,但速度顯著提升。
How it works
該專案在 MLX 上原生實作了兩種 EAGLE 系列的投機解碼 drafters:
- DSpark: 來自 DeepSeek 的 DeepSpec 程式碼庫的半自回歸 drafter。
- DFlash: 來自 z-lab 的區塊擴散(block diffusion)drafter。
它也支援針對任何模型的 n-gram lookup speculation(無需 drafter)。引擎會自動針對特定的 Mac 硬體(從 M1 到 M4)進行校準,以確定最佳的草稿長度(draft length)以實現最大加速。它具備用於處理並行請求的連續批次處理(continuous batching)功能,以及用於避免在多輪對話中重複處理長系統提示詞(system prompts)的前綴快取(prefix caching)功能。
Who it’s for
- Mac 使用者:執行本地 LLM 且希望在不犧牲模型品質的前提下,顯著提高每秒 token 數(tokens-per-second)的使用者。
- 開發者:正在構建 AI agent(例如 Claude Code 或 pi)且需要在本地硬體上進行快速 prefill 和生成的使用者。
- 研究人員:在 Apple Silicon 上對投機解碼方法進行基準測試的使用者。
Highlights
- 無損加速:保證輸出與目標模型完全相同。
- 廣泛的模型支援:針對 Gemma-4、Qwen3、Muse-Glimmer、Ornith-1.0 和 Nemotron 進行了優化。
- 雙 API 支援:在單一連接埠上同時提供 OpenAI 相容的與 Anthropic Messages API 端點。
- 原生 Mac App:包含用於模型管理、即時遙測(telemetry)和「Race」模式(用於比較解碼速度)的 GUI。
- Agent 整合:特別針對在本地驅動 Claude Code 和 pi 等工具進行了優化。
- C-level 效能:在 M4 Pro 硬體上,針對特定模型(例如 Qwen3.8-27B)可實現高達 3.37 倍的加速。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案