youssofal/MTPLX
3x faster speeds on MLX | Qwen 3.8 27B | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.
解决的问题
MTPLX 加速了 Apple Silicon Mac 上本地大语言模型(LLM)的执行。它通过利用现代模型(如 Qwen 3.5/3.6/3.8)中已有的多标记预测(MTP)头,解决了标准自回归解码的低效问题,使模型能够在不依赖额外内存消耗的独立草稿模型的情况下,一次性起草并验证多个标记。
工作原理
MTPLX 使用模型自身内置的 MTP 头,提前起草多个标记。然后通过一次批量前向传播验证这些起草的块。为确保输出在数学上与标准采样完全一致,它采用基于 Leviathan 和 Chen 定理的精确拒绝采样与残差校正。这使其在保持输出分布不变(无论温度或 top_p 设置如何)的同时,显著提升速度(报告最高达 2.24 倍)。
适用人群
- Mac 用户:拥有 Apple Silicon(M1 或更新)和 macOS 14+,希望更快运行本地 LLM 的用户。
- 开发者:需要为本地代理、代码助手(如 Claude Code 或 Cline)、或 RAG 流水线提供 OpenAI 或 Anthropic 兼容 API 服务器的开发者。
- 模型创建者:希望使用集成的「Forge」工具训练、验证并发布 MTP 支持模型的用户。
主要亮点
- 原生 Mac 体验:以 DMG 应用形式提供,支持自动硬件检测、模型推荐和风扇控制。
- LTP 原生速度:利用内置 MTP 头实现更快解码,无需额外内存开销。
- 自动调优:自动测量特定 Mac 硬件(芯片、带宽、散热)的最优起草深度,以最大化每秒标记数。
- 统一服务器:提供一个 OpenAI/Anthropic 兼容 API,可从单一守护进程服务聊天模型、嵌入模型和重排序模型。
- Forge 工具链:包含将 Hugging Face 仓库转换为 MLX、训练 MTP 适配器、验证速度提升的实用工具。
- 会话管理:支持热前缀会话银行和 SSD 会话缓存,实现多轮对话的近乎即时恢复。
相关
- 项目
- 项目
- 项目
- 项目
- 项目