ARahim3/mlx-dspark

Up to 4× faster LLM decoding on Apple Silicon, lossless. Native MLX port of DeepSeek's DSpark & z-lab's DFlash speculative decoding — Gemma-4, Qwen3.8, Muse-Glimmer, Nemotron, LFM2.5, Ornith-1.0, ternary Bonsai-27B.

해결하는 문제

mlx-dspark는 Apple Silicon을 위한 고성능 추론 엔진으로, 대규모 언어 모델(LLM)의 생성 속도를 가속화하기 위해 사전 추론(speculative decoding)을 구현합니다. 이는 더 작은, 더 빠른 모델인 '드래프터'(drafters)를 사용해 한 번에 여러 토큰을 예측함으로써, 토큰 단위로 하나씩 생성하는 느린 과정을 제거합니다. 이후 주요 타겟 모델이 이 예측된 토큰들을 단일 패스로 검증합니다. 이 과정은 손실이 없으며, 최종 출력은 타겟 모델을 단독으로 실행했을 때와 완전히 동일하지만 훨씬 빠릅니다.

작동 방식

이 프로젝트는 MLX에서 직접 구현된 두 가지 EAGLE 계열의 사전 추론 드래프터를 제공합니다:

  • DSpark: DeepSeek의 DeepSpec 코드베이스에서 나온 반자기적 드래프터(semi-autoregressive drafter).
  • DFlash: z-lab에서 나온 블록 확산 드래프터(block diffusion drafter).

또한, n-gram 조회 추론(drafter-free)을 모든 모델에 대해 지원합니다. 엔진은 특정 맥 하드웨어(M1부터 M4까지)에 자동으로 보정되어 최적의 드래프트 길이를 결정하여 최대 속도 향상을 달성합니다. 동시 요청을 위한 지속적 배치(continuous batching)와 다중 대화에서 긴 시스템 프롬프트를 다시 처리하지 않기 위한 접두사 캐싱(prefix caching) 기능을 갖추고 있습니다.

대상 사용자

  • 로컬 LLM을 실행하는 맥 사용자로, 모델 품질을 희생하지 않고 토큰/초 단위 속도를 크게 높이고 싶은 사용자.
  • 로컬 하드웨어에서 빠른 프리필(prefill)과 생성이 필요한 AI 에이전트(예: Claude Code 또는 pi)를 개발하는 개발자.
  • Apple Silicon에서 사전 추론 방법을 벤치마킹하는 연구자.

주요 특징

  • 손실 없는 가속: 타겟 모델과 완전히 동일한 출력을 보장합니다.
  • 광범위한 모델 지원: Gemma-4, Qwen3, Muse-Glimmer, Ornith-1.0, Nemotron에 최적화되어 있습니다.
  • 이중 API 지원: 단일 포트에서 OpenAI 호환 및 Anthropic Messages API 엔드포인트를 모두 제공합니다.
  • 네이티브 맥 앱: 모델 관리, 실시간 텔레메트리, 디코딩 속도를 비교할 수 있는 '레이스' 모드를 포함한 GUI를 제공합니다.
  • 에이전트 통합: Claude Code 및 pi와 같은 도구를 로컬에서 최적화하여 작동하도록 설계되었습니다.
  • C 수준 성능: M4 Pro 하드웨어에서 특정 모델(예: Qwen3.8-27B)에 대해 최대 3.37배의 속도 향상을 달성합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트