youssofal/MTPLX

3x faster speeds on MLX | Qwen 3.8 27B | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.

해결하는 문제

MTPLX는 Apple Silicon 맥에서 로컬 대규모 언어 모델(LLM)의 실행을 가속화합니다. Qwen 3.5/3.6/3.8와 같은 현대 모델에 이미 내장된 다중 토큰 예측(MTP) 헤드를 활용하여 표준 자기회귀적 디코딩의 비효율성을 해결합니다. 별도의 메모리 소모가 큰 드래프트 모델이 필요 없이, 여러 토큰을 동시에 드래프트하고 검증할 수 있습니다.

작동 방식

MTPLX는 모델 자체의 내장된 MTP 헤드를 사용하여 현재 위치보다 여러 토큰을 미리 드래프트합니다. 이후 이 드래프트된 블록들을 단일 배치 전방 연산으로 검증합니다. 표준 샘플링과 수학적으로 동일한 출력을 보장하기 위해, Leviathan과 Chen 정리에 기반한 정확한 거부 샘플링과 잔차 보정을 사용합니다. 이로 인해 온도나 top_p 설정과 관계없이 동일한 출력 분포를 유지하면서도 속도를 높일 수 있으며, 보고된 최대 2.24배의 성능 향상이 가능합니다.

대상 사용자

  • 맥 사용자: Apple Silicon(M1 이상)과 macOS 14 이상을 사용하며, 로컬 LLM을 더 빠르게 실행하고 싶은 사용자.
  • 개발자: 로컬 에이전트, 코드 어시스턴트(Claude Code, Cline 등), RAG 파이프라인용 OpenAI 또는 Anthropic 호환 API 서버가 필요한 개발자.
  • 모델 제작자: 통합된 "Forge" 도구를 사용해 MTP 기능을 갖춘 모델을 훈련, 검증, 배포하고 싶은 사용자.

주요 특징

  • 네이티브 맥 경험: 자동 하드웨어 검사, 모델 추천, 팬 제어 기능을 갖춘 DMG 앱으로 제공.
  • LTP 네이티브 속도: 추가 RAM 오버헤드 없이 내장된 MTP 헤드를 활용해 더 빠른 디코딩을 구현.
  • 자동 튜닝: 특정 맥의 하드웨어(칩, 대역폭, 열 성능)에 최적화된 드래프트 깊이를 자동 측정하여 초당 토큰 수를 최대화.
  • 통합 서버: 하나의 데몬에서 채팅 모델, 임베딩 모델, 재정렬 모델을 OpenAI/Anthropic 호환 API로 제공.
  • Forge 도구: Hugging Face 리포지토리를 MLX로 변환하고, MTP 어댑터를 훈련하며, 속도 향상을 검증할 수 있는 유틸리티 포함.
  • 세션 관리: 웜프리픽스 세션 백업과 SSD 세션 캐시를 통해 멀티턴 대화를 거의 즉시 복원 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트