youssofal/MTPLX
3x faster speeds on MLX | Qwen 3.8 27B | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.
解決的問題
MTPLX 加速了 Apple Silicon Mac 上本地大型語言模型(LLM)的執行。它特別針對標準自回歸解碼的低效率,利用現代模型(如 Qwen 3.5/3.6/3.8)內建的多標記預測(MTP)頭,讓模型能一次起草並驗證多個標記,無需額外、記憶體消耗大的草稿模型。
如何運作
MTPLX 使用模型自身的內建 MTP 頭,提前起草數個標記。接著以單一批次前向傳播驗證這些起草的區塊。為確保輸出在數學上與標準採樣完全一致,它採用基於 Leviathan 與 Chen 定理的精確拒絕採樣與殘差修正。這讓它能在維持相同輸出分佈(無論溫度或 top_p 設定為何)的同時,大幅提升速度(報告最高達 2.24 倍)。
適用對象
- Mac 使用者:擁有 Apple Silicon(M1 或更新)與 macOS 14+,希望更快執行本地 LLM 的使用者。
- 開發者:需要為本地代理、程式碼助手(如 Claude Code 或 Cline)、或 RAG 管線提供 OpenAI 或 Anthropic 兼容 API 伺服器的開發者。
- 模型創作者:希望使用整合的「Forge」工具訓練、驗證並發佈 MTP 支援模型的使用者。
主要亮點
- 原生 Mac 經驗:以 DMG 應用形式提供,支援自動硬體檢測、模型推薦與風扇控制。
- LTP 原生速度:利用內建 MTP 頭實現更快解碼,無需額外記憶體開銷。
- 自動調校:自動測量特定 Mac 硬體(晶片、頻寬、散熱)的最適起草深度,以最大化每秒標記數。
- 統一伺服器:提供一個 OpenAI/Anthropic 兼容 API,可從單一守護程序服務聊天模型、嵌入模型與重排序模型。
- Forge 工具鏈:內建工具可將 Hugging Face 倉庫轉換為 MLX、訓練 MTP 適配器,並驗證速度提升。
- 會話管理:具備熱前綴會話銀行與 SSD 會話快取,可近乎即時恢復多輪對話。
相關
- 專案
- 專案
- 專案
- 專案
- 專案