sudoingX/qwen38-mtp
One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.
Qwen3.8‑27B MTP – llama.cpp 的社区发现速度提升
这是什么
- 一组用于 llama.cpp 的命令行标志,可为以 GGUF 格式分发的 Qwen‑3.8‑27B 模型启用推测性多标记预测(MTP)解码。使用标志组合(
--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1)可在无需模型转换或自定义构建的情况下,使消费级 GPU 上的模型生成速度提升 33 %–145 %。
为何重要
- 速度提升源于 draft‑MTP:服务器首先使用轻量级头生成多个标记,仅对验证失败的标记运行完整模型。这减少了昂贵的前向传播次数。
- 社区已映射出 53 种不同的硬件配置(从 2016 年的 Pascal GPU 到 2026 年的 Blackwell 卡、Apple Silicon,甚至解锁的矿卡),并提炼出 七条实用的调优规则,帮助用户在自己的设备上复现该加速效果。
如何使用
- 下载 GGUF:获取 Qwen‑3.8‑27B(例如
unsloth/Qwen3.8‑27B‑GGUF) - 运行参考命令(如需调整上下文长度,请修改
-c):llama-server -m Qwen3.8-27B-Q4_K_M.gguf \ -c 131072 -ngl 999 -fa 1 \ --cache-type-k q4_0 --cache-type-v q4_0 \ --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 - 调优:
- 扫描
--spec-draft-n-max(2–4)以找到适合您 GPU 的最佳值。 - 在带宽受限的机器上,尝试
--spec-draft-p-min 0.60‑0.75。 - 对于多 GPU 环境,在应用 spec 标志前设置
--split-mode tensor。 - 始终使用
--parallel 1进行基准测试(多并发流时 spec 优势消失)。
- 扫描
- 测量效果:使用提供的
probe.py脚本,从服务器流式传输标记并报告每提示的中位速度。
社区数据的关键发现
- GPU 类型很重要:24 GB 显卡(RTX 3090/4090)通常在
n‑max = 2时达到峰值;更新、更快的显卡(RTX 5090、Blackwell)可支持n‑max = 4‑6。 - 分片模式(
layer与tensor)在双 GPU 配对中可带来额外 +68 % 的提升。 - 并行性:spec 速度提升是 单流 优化;使用
--parallel 4会消除该优势。 - 内存压力:在共享桌面环境中,操作系统可能将权重溢出到主机内存,导致速度减半。请以无头模式运行,或确认模型完全驻留在内存中(使用
mem_info_gtt_used或厂商特定工具)。 - 基线 vs. spec:在 53 种报告的显卡中,加速范围从温和(+30 %)到显著(+180 %),尤其在大上下文窗口(256 K 标记)中,完整前向传播的开销占主导,效果更明显。
谁会受益
- 任何使用 llama.cpp 本地运行 Qwen‑3.8‑27B 的人——研究人员、爱好者或开发 AI 增强应用的开发者——希望在不购买新硬件的情况下获得更快的生成速度。
- 该仓库还作为持续更新的基准测试集合;贡献者可通过提交 PR 添加自己的测量数据。
注意事项
- 速度提升是在 单流 解码下测量的;多用户服务器不会看到相同提升。
- 提示嵌入传输会带来轻微开销。
- 结果取决于驱动版本、温度和精确的 llama.cpp 构建;建议在调优前重新构建 llama.cpp。
TL;DR: 通过在 llama.cpp 中启用 draft‑mtp 推测解码标志,社区已将 Qwen‑3.8‑27B GGUF 在多种 GPU 上转变为更快的模型,该仓库记录了重现这些提升所需的精确标志组合、调优规则和基准数据。
相关
- 项目
- 项目
- 项目
- 项目