ARahim3/mlx-dspark

Up to 4× faster LLM decoding on Apple Silicon, lossless. Native MLX port of DeepSeek's DSpark & z-lab's DFlash speculative decoding — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

What it solves

mlx-dsparkは、Apple Silicon向けの高パフォーマンスな推論エンジンであり、投機的デコーディング(speculative decoding)を実装することで、大規模言語モデル(LLM)の生成速度を加速させます。これは、「drafters」(より小さく、より高速なモデル)を使用して一度に複数のトークンを予測し、メインのターゲットモデルがそれを一度のパスで検証することで、低速なトークンごとの生成プロセスを排除します。このプロセスはロスレス(lossless)であり、最終的な出力はターゲットモデル単体で実行した場合と同一ですが、大幅に速度が向上します。

How it works

このプロジェクトは、EAGLEファミリーの投機的デコーディング・ドラフターを2種類、MLX上でネイティブに実装しています:

  • DSpark: DeepSeekのDeepSpecコードベースからの、セミオートレグレッシブなドラフター。
  • DFlash: z-labによる、ブロック拡散(block diffusion)ドラフター。

また、あらゆるモデルに対して、ドラフターを使用しないn-gram lookup speculationもサポートしています。このエンジンは、特定のMacハードウェア(M1からM4まで)に合わせて自動的にキャリブレーションを行い、最大限のスピードアップを実現するための最適なドラフト長を決定します。また、並行リクエストのための継続的バッチ処理(continuous batching)や、マルチターン会話における長いシステムプロンプトの再処理を避けるためのプレフィックス・キャッシュ(prefix caching)も備えています。

Who it’s for

  • Macユーザー:モデルの品質を犠牲にすることなく、大幅に高いトークン/秒(tokens-per-second)を求める、ローカルLLMを実行しているユーザー。
  • 開発者:ローカルハードウェア上で高速なプリフィル(prefill)と生成を必要とするAIエージェント(Claude Codeやpiなど)を構築している開発者。
  • 研究者:Apple Silicon上で投機的デコーディング手法のベンチマークを行っている研究者。

Highlights

  • Lossless Acceleration: ターゲットモデルと同一の出力を保証します。
  • Broad Model Support: Gemma-4, Qwen3, Muse-Glimmer, Ornith-1.0, Nemotron向けに最適化されています。
  • Dual API Support: 単一のポートで、OpenAI互換およびAnthropic Messages APIのエンドポイントの両方を提供します。
  • Native Mac App: モデル管理、ライブテレメトリ、およびデコーディング速度を比較するための「Race」モードを備えたGUIが含まれています。
  • Agent Integration: Claude Codeやpiなどのツールをローカルで駆動させるために特別に最適化されています。
  • C-level Performance: M4 Proハードウェア上で、特定のモデル(例:Qwen3.8-27B)において最大3.37倍のスピードアップを達成します。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト