ARahim3/mlx-dspark

Up to 4× faster LLM decoding on Apple Silicon, lossless. Native MLX port of DeepSeek's DSpark & z-lab's DFlash speculative decoding — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

What it solves

mlx-dspark 是一个专为 Apple Silicon 设计的高性能推理引擎,它通过实现投机解码(speculative decoding)来加速大语言模型(LLMs)的生成速度。它通过使用“drafters”(更小、更快的模型)一次性预测多个 token,然后由主目标模型进行单次验证,从而消除了缓慢的逐个 token 生成过程。这个过程是无损的,这意味着最终输出与单独运行目标模型完全相同,但速度显著提高。

How it works

该项目在 MLX 上原生实现了两种 EAGLE 系列的投机解码 drafter:

  • DSpark: 来自 DeepSeek 的 DeepSpec 代码库的半自回归 drafter。
  • DFlash: 来自 z-lab 的块扩散(block diffusion)drafter。

它还支持针对任何模型的 n-gram lookup speculation(无需 drafter)。引擎会自动针对特定的 Mac 硬件(从 M1 到 M4)进行校准,以确定最佳的草案长度(draft length)以实现最大加速。它具有用于并发请求的连续批处理(continuous batching)功能,以及用于避免在多轮对话中重复处理长系统提示词的前缀缓存(prefix caching)功能。

Who it’s for

  • Mac 用户:运行本地 LLM 且希望在不牺牲模型质量的前提下显著提高每秒 token 数(tokens-per-second)的用户。
  • 开发者:正在构建 AI agent(例如 Claude Code 或 pi)且需要在本地硬件上实现快速预填充(prefill)和生成的用户。
  • 研究人员:在 Apple Silicon 上对投机解码方法进行基准测试的研究人员。

Highlights

  • 无损加速:保证输出与目标模型完全一致。
  • 广泛的模型支持:针对 Gemma-4, Qwen3, Muse-Glimmer, Ornith-1.0, 和 Nemotron 进行了优化。
  • Dual API 支持:在单个端口上同时提供兼容 OpenAI 和 Anthropic Messages API 的端点。
  • 原生 Mac 应用:包含用于模型管理、实时遥测和“Race”模式(用于比较解码速度)的 GUI。
  • Agent 集成:专门针对在本地驱动 Claude Code 和 pi 等工具进行了优化。
  • C 级性能:在 M4 Pro 硬件上,针对特定模型(例如 Qwen3.8-27B)实现了高达 3.37x 的加速。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目