ARahim3/mlx-dspark
Up to 4× faster LLM decoding on Apple Silicon, lossless. Native MLX port of DeepSeek's DSpark & z-lab's DFlash speculative decoding — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.
What it solves
mlx-dspark 是一个专为 Apple Silicon 设计的高性能推理引擎,它通过实现投机解码(speculative decoding)来加速大语言模型(LLMs)的生成速度。它通过使用“drafters”(更小、更快的模型)一次性预测多个 token,然后由主目标模型进行单次验证,从而消除了缓慢的逐个 token 生成过程。这个过程是无损的,这意味着最终输出与单独运行目标模型完全相同,但速度显著提高。
How it works
该项目在 MLX 上原生实现了两种 EAGLE 系列的投机解码 drafter:
- DSpark: 来自 DeepSeek 的 DeepSpec 代码库的半自回归 drafter。
- DFlash: 来自 z-lab 的块扩散(block diffusion)drafter。
它还支持针对任何模型的 n-gram lookup speculation(无需 drafter)。引擎会自动针对特定的 Mac 硬件(从 M1 到 M4)进行校准,以确定最佳的草案长度(draft length)以实现最大加速。它具有用于并发请求的连续批处理(continuous batching)功能,以及用于避免在多轮对话中重复处理长系统提示词的前缀缓存(prefix caching)功能。
Who it’s for
- Mac 用户:运行本地 LLM 且希望在不牺牲模型质量的前提下显著提高每秒 token 数(tokens-per-second)的用户。
- 开发者:正在构建 AI agent(例如 Claude Code 或 pi)且需要在本地硬件上实现快速预填充(prefill)和生成的用户。
- 研究人员:在 Apple Silicon 上对投机解码方法进行基准测试的研究人员。
Highlights
- 无损加速:保证输出与目标模型完全一致。
- 广泛的模型支持:针对 Gemma-4, Qwen3, Muse-Glimmer, Ornith-1.0, 和 Nemotron 进行了优化。
- Dual API 支持:在单个端口上同时提供兼容 OpenAI 和 Anthropic Messages API 的端点。
- 原生 Mac 应用:包含用于模型管理、实时遥测和“Race”模式(用于比较解码速度)的 GUI。
- Agent 集成:专门针对在本地驱动 Claude Code 和 pi 等工具进行了优化。
- C 级性能:在 M4 Pro 硬件上,针对特定模型(例如 Qwen3.8-27B)实现了高达 3.37x 的加速。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目