sudoingX/qwen38-mtp

One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.

Qwen3.8‑27B MTP – llama.cpp 的社区发现速度提升

这是什么

  • 一组用于 llama.cpp 的命令行标志,可为以 GGUF 格式分发的 Qwen‑3.8‑27B 模型启用推测性多标记预测(MTP)解码。使用标志组合(--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1)可在无需模型转换或自定义构建的情况下,使消费级 GPU 上的模型生成速度提升 33 %–145 %

为何重要

  • 速度提升源于 draft‑MTP:服务器首先使用轻量级头生成多个标记,仅对验证失败的标记运行完整模型。这减少了昂贵的前向传播次数。
  • 社区已映射出 53 种不同的硬件配置(从 2016 年的 Pascal GPU 到 2026 年的 Blackwell 卡、Apple Silicon,甚至解锁的矿卡),并提炼出 七条实用的调优规则,帮助用户在自己的设备上复现该加速效果。

如何使用

  1. 下载 GGUF:获取 Qwen‑3.8‑27B(例如 unsloth/Qwen3.8‑27B‑GGUF
  2. 运行参考命令(如需调整上下文长度,请修改 -c):
    llama-server -m Qwen3.8-27B-Q4_K_M.gguf \
      -c 131072 -ngl 999 -fa 1 \
      --cache-type-k q4_0 --cache-type-v q4_0 \
      --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1
    
  3. 调优
    • 扫描 --spec-draft-n-max(2–4)以找到适合您 GPU 的最佳值。
    • 在带宽受限的机器上,尝试 --spec-draft-p-min 0.60‑0.75
    • 对于多 GPU 环境,在应用 spec 标志前设置 --split-mode tensor
    • 始终使用 --parallel 1 进行基准测试(多并发流时 spec 优势消失)。
  4. 测量效果:使用提供的 probe.py 脚本,从服务器流式传输标记并报告每提示的中位速度。

社区数据的关键发现

  • GPU 类型很重要:24 GB 显卡(RTX 3090/4090)通常在 n‑max = 2 时达到峰值;更新、更快的显卡(RTX 5090、Blackwell)可支持 n‑max = 4‑6
  • 分片模式layertensor)在双 GPU 配对中可带来额外 +68 % 的提升。
  • 并行性:spec 速度提升是 单流 优化;使用 --parallel 4 会消除该优势。
  • 内存压力:在共享桌面环境中,操作系统可能将权重溢出到主机内存,导致速度减半。请以无头模式运行,或确认模型完全驻留在内存中(使用 mem_info_gtt_used 或厂商特定工具)。
  • 基线 vs. spec:在 53 种报告的显卡中,加速范围从温和(+30 %)到显著(+180 %),尤其在大上下文窗口(256 K 标记)中,完整前向传播的开销占主导,效果更明显。

谁会受益

  • 任何使用 llama.cpp 本地运行 Qwen‑3.8‑27B 的人——研究人员、爱好者或开发 AI 增强应用的开发者——希望在不购买新硬件的情况下获得更快的生成速度。
  • 该仓库还作为持续更新的基准测试集合;贡献者可通过提交 PR 添加自己的测量数据。

注意事项

  • 速度提升是在 单流 解码下测量的;多用户服务器不会看到相同提升。
  • 提示嵌入传输会带来轻微开销。
  • 结果取决于驱动版本、温度和精确的 llama.cpp 构建;建议在调优前重新构建 llama.cpp。

TL;DR: 通过在 llama.cpp 中启用 draft‑mtp 推测解码标志,社区已将 Qwen‑3.8‑27B GGUF 在多种 GPU 上转变为更快的模型,该仓库记录了重现这些提升所需的精确标志组合、调优规则和基准数据。

相关

  • 项目
  • 项目
  • 项目
  • 项目