sudoingX/qwen38-mtp

One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.

Qwen3.8‑27B MTP – 由社群發現的 llama.cpp 速度提升

這是什麼

  • 一組用於 llama.cpp 的命令列旗標,可為以 GGUF 格式分發的 Qwen‑3.8‑27B 模型啟用推測性多標記預測(MTP)解碼。使用旗標組合(--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1)可在不需模型轉換或自訂建構的情況下,使消費級 GPU 上的模型生成速度提升 33 %–145 %

為何重要

  • 速度提升來自 draft‑MTP:伺服器首先以輕量級頭生成多個標記,僅對驗證失敗的標記執行完整模型。這可減少昂貴的前向傳播次數。
  • 社群已映射出 53 種不同的硬體組態(從 2016 年的 Pascal GPU 到 2026 年的 Blackwell 顯卡、Apple Silicon,甚至解鎖的挖礦卡),並萃取出 七條實用的調校規則,讓使用者能在自己的裝置上重現此加速效果。

如何使用

  1. 下載 GGUF:取得 Qwen‑3.8‑27B(例如 unsloth/Qwen3.8‑27B‑GGUF
  2. 執行參考命令(如需調整上下文長度,請修改 -c):
    llama-server -m Qwen3.8-27B-Q4_K_M.gguf \
      -c 131072 -ngl 999 -fa 1 \
      --cache-type-k q4_0 --cache-type-v q4_0 \
      --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1
    
  3. 調校
    • 掃描 --spec-draft-n-max(2–4)以找到適合您 GPU 的最佳值。
    • 在頻寬受限的機器上,嘗試 --spec-draft-p-min 0.60‑0.75
    • 對於多 GPU 環境,在套用 spec 旗標前設定 --split-mode tensor
    • 始終使用 --parallel 1 進行基準測試(多個併發串流時 spec 優勢消失)。
  4. 測量效果:使用提供的 probe.py 腳本,從伺服器串流標記並報告每提示的中位速度。

社群數據中的關鍵發現

  • GPU 類型很重要:24 GB 顯卡(RTX 3090/4090)通常在 n‑max = 2 時達到峰值;更新、更快的顯卡(RTX 5090、Blackwell)可支援 n‑max = 4‑6
  • 分片模式layertensor)在雙 GPU 組合中可帶來額外 +68 % 的提升。
  • 平行性:spec 速度提升是 單串流 最佳化;使用 --parallel 4 會消除該優勢。
  • 記憶體壓力:在共享桌面環境中,作業系統可能將權重溢出至主機記憶體,導致速度減半。請以無頭模式執行,或確認模型完全駐留於記憶體中(使用 mem_info_gtt_used 或廠商特定工具)。
  • 基線 vs. spec:在 53 種報告的顯卡中,加速範圍從溫和(+30 %)到顯著(+180 %),尤其在大上下文視窗(256 K 標記)中,完整前向傳播的開銷占主導,效果更明顯。

誰會受益

  • 任何使用 llama.cpp 本地運行 Qwen‑3.8‑27B 的人——研究人員、愛好者或開發 AI 增強應用的開發者——希望在不購買新硬體的情況下獲得更快的生成速度。
  • 此倉儲也作為持續更新的基準測試集合;貢獻者可透過提交 PR 加入自己的測量數據。

注意事項

  • 速度提升是在 單串流 解碼下測量的;多使用者伺服器不會看到相同提升。
  • 提示嵌入傳輸會帶來輕微開銷。
  • 結果取決於驅動程式版本、溫度和精確的 llama.cpp 建構;建議在調校前重新建構 llama.cpp。

TL;DR: 透過在 llama.cpp 中啟用 draft‑mtp 推測解碼旗標,社群已將 Qwen‑3.8‑27B GGUF 在多種 GPU 上轉變為更快速的模型,該倉儲記錄了重現這些提升所需的精確旗標組合、調校規則和基準數據。

相關

  • 專案
  • 專案
  • 專案
  • 專案