sudoingX/qwen38-mtp
One llama.cpp flag unlocks +33-39% decode speed for Qwen3.8-27B on consumer GPUs. The MTP head already ships inside your GGUF. Recipe, paired benchmarks, probe tool.
Qwen3.8‑27B MTP – 由社群發現的 llama.cpp 速度提升
這是什麼
- 一組用於 llama.cpp 的命令列旗標,可為以 GGUF 格式分發的 Qwen‑3.8‑27B 模型啟用推測性多標記預測(MTP)解碼。使用旗標組合(
--spec-type draft-mtp --spec-draft-n-max 2 --parallel 1)可在不需模型轉換或自訂建構的情況下,使消費級 GPU 上的模型生成速度提升 33 %–145 %。
為何重要
- 速度提升來自 draft‑MTP:伺服器首先以輕量級頭生成多個標記,僅對驗證失敗的標記執行完整模型。這可減少昂貴的前向傳播次數。
- 社群已映射出 53 種不同的硬體組態(從 2016 年的 Pascal GPU 到 2026 年的 Blackwell 顯卡、Apple Silicon,甚至解鎖的挖礦卡),並萃取出 七條實用的調校規則,讓使用者能在自己的裝置上重現此加速效果。
如何使用
- 下載 GGUF:取得 Qwen‑3.8‑27B(例如
unsloth/Qwen3.8‑27B‑GGUF) - 執行參考命令(如需調整上下文長度,請修改
-c):llama-server -m Qwen3.8-27B-Q4_K_M.gguf \ -c 131072 -ngl 999 -fa 1 \ --cache-type-k q4_0 --cache-type-v q4_0 \ --spec-type draft-mtp --spec-draft-n-max 2 --parallel 1 - 調校:
- 掃描
--spec-draft-n-max(2–4)以找到適合您 GPU 的最佳值。 - 在頻寬受限的機器上,嘗試
--spec-draft-p-min 0.60‑0.75。 - 對於多 GPU 環境,在套用 spec 旗標前設定
--split-mode tensor。 - 始終使用
--parallel 1進行基準測試(多個併發串流時 spec 優勢消失)。
- 掃描
- 測量效果:使用提供的
probe.py腳本,從伺服器串流標記並報告每提示的中位速度。
社群數據中的關鍵發現
- GPU 類型很重要:24 GB 顯卡(RTX 3090/4090)通常在
n‑max = 2時達到峰值;更新、更快的顯卡(RTX 5090、Blackwell)可支援n‑max = 4‑6。 - 分片模式(
layer與tensor)在雙 GPU 組合中可帶來額外 +68 % 的提升。 - 平行性:spec 速度提升是 單串流 最佳化;使用
--parallel 4會消除該優勢。 - 記憶體壓力:在共享桌面環境中,作業系統可能將權重溢出至主機記憶體,導致速度減半。請以無頭模式執行,或確認模型完全駐留於記憶體中(使用
mem_info_gtt_used或廠商特定工具)。 - 基線 vs. spec:在 53 種報告的顯卡中,加速範圍從溫和(+30 %)到顯著(+180 %),尤其在大上下文視窗(256 K 標記)中,完整前向傳播的開銷占主導,效果更明顯。
誰會受益
- 任何使用 llama.cpp 本地運行 Qwen‑3.8‑27B 的人——研究人員、愛好者或開發 AI 增強應用的開發者——希望在不購買新硬體的情況下獲得更快的生成速度。
- 此倉儲也作為持續更新的基準測試集合;貢獻者可透過提交 PR 加入自己的測量數據。
注意事項
- 速度提升是在 單串流 解碼下測量的;多使用者伺服器不會看到相同提升。
- 提示嵌入傳輸會帶來輕微開銷。
- 結果取決於驅動程式版本、溫度和精確的 llama.cpp 建構;建議在調校前重新建構 llama.cpp。
TL;DR: 透過在 llama.cpp 中啟用 draft‑mtp 推測解碼旗標,社群已將 Qwen‑3.8‑27B GGUF 在多種 GPU 上轉變為更快速的模型,該倉儲記錄了重現這些提升所需的精確旗標組合、調校規則和基準數據。
相關
- 專案
- 專案
- 專案
- 專案