Unsloth Dynamic 3.0 GGUF 發佈
Unsloth Dynamic 3.0 在同等大小下提供更高的準確度
Unsloth Dynamic v3.0 是相對於 Dynamic v2.0 的重大升級,專門設計用於在保持相同磁碟佔用空間的同時,保留更多的模型品質。對於 Qwen3.8-27B 模型,Dynamic 3.0 量化版本在相同大小下,其 top-1% 準確度比其他所有供應商高出 10% 以上。這些 GGUF 與大多數推論引擎相容,包括 llama.cpp 和 Unsloth Desktop。
Dynamic 3.0 的關鍵技術改進
Dynamic 3.0 透過在訓練後量化 (PTQ) 中的幾種方法論轉變來實現性能增益:
- 高品質校準數據集: Unsloth 現在使用經過精煉的 imatrix 校準數據集,其來源多樣化,並特別針對多語言性能、對話和代理編碼進行了優化。
- 增強的層選擇: 改進了選擇哪些層進行量化以及如何進行量化的過程,以最大限度地保留品質。
- 純 PTQ 方法: Unsloth 明確表示不使用量化感知訓練 (QAT) 或量化感知蒸餾 (QAD),也不在 imatrix 校準數據集上進行訓練。與 QAD/QAT 方法相比,這種方法降低了過擬合的風險。
模型特定的優化與體積縮減
為了優化磁碟空間和性能,Unsloth 對 Qwen3.8-27B 量化版本實施了特定更改:
- 移除 MTP 模組: 對於低於
UD-Q2_K_XL(8.37GB 及以下) 的較小量化版本,移除了 MTP 模組以節省約 500MB 的磁碟空間。需要 MTP 的用戶仍可使用獨立的Q4_0MTP 模組。 - 極限壓縮:
UD-IQ1_S量化版本為 6.2GB (不含 MTP),在比完整模型小 89% 的情況下,仍保留了約 72% 的 top-1% 準確度。 - 改進的低位元量化性能:
UD-Q2_K_XL量化版本 (9.83GB) 在 top-1% 準確度上比次佳的替代方案高出約 8%,並已證明能夠生成先前無法運行的 HTML 程式。
基準測試方法論:Divergence-300 與 KL Divergence
Unsloth 主張標準的 top-1% 準確度 (單次預測的 argmax) 不足以衡量實際的推論性能。為了應對這一點,他們引入了兩個主要指標:
Divergence-300 @32
此指標使用來自 Terminal-Bench 2.1、DeepSWE、Harbor 和 MathArena 2025-26 等來源的 300 個範例的保留數據集。該過程涉及對 32 個 token 進行貪婪 argmax 解碼,並將量化模型的軌跡與 BF16 (全精度) 版本進行比較。這可以判斷量化模型的輸出是否在多個 token 期間保持與原版相似,從而提供比單一 token 準確度更好的過擬合衡量標準。
KL Divergence (KLD)
Unsloth 將 KL Divergence 視為報告量化誤差的黃金標準,因為它衡量「翻轉」——即答案從錯誤變為正確或反之亦然的情況。他們主張 perplexity 是一個錯誤的指標,因為輸出 token 的值可能會互相抵消。為了防止過擬合,Unsloth 在未見過的數據集 (例如 Wikitext 和 Code) 上進行 KLD 基準測試,而不是在校準數據集上。
與 Google 的 Gemma 3 QAT 之比較
Unsloth 將其 Dynamic 量化版本與 Google 官方的 Gemma 3 量化感知訓練 (QAT) 版本進行了基準測試。對於 Gemma 3 (27B) 模型,Unsloth 發現其 dynamic 4-bit 版本比 Google QAT 版本小 2GB,同時在 5-shot MMLU 上提供了 +1% 的額外準確度。
Unsloth 還引入了一種 效率指標 (Efficiency Metric) 來評估模型相對於其大小的實用性:
$$\text{Efficiency} = \frac{\text{MMLU 5-shot score} - 25}{\text{Disk Space GB}}$$
此公式從分數中減去 25,以考慮 4 選 1 的 MMLU 測試的隨機機率基準線。
Llama 4 Bug Fixes 與整合
Unsloth 為開源生態系統貢獻了幾個關鍵修復,以提高 Llama 4 的性能:
- RoPE Scaling: 解決了 llama.cpp 中的問題,以支持 Llama 4 Scout RoPE Scaling 配置的更改。
- QK Norm Epsilon: 修復了 llama.cpp 和 transformers 中的 Scout 和 Maverick 的 QK Norm epsilon,確保其使用 1e-05 而不是 1e-06。
- QK Norm Sharing: 與 Llama 4 團隊和 vLLM 合作修復了一個問題,即 QK Norm 在所有 head 之間共享,這使得 MMLU Pro 準確度從 68.58% 提高到 71.53%。
社群群眾之見與回饋饋
關於此次發佈的社群討論突出了幾個實際的問題與請求:
- 版本控制: 用戶指出 GGUF 文件夾經常在不同版本之間共享相同的名稱 (例如,Dynamic 2.0 vs 3.0),這使得在文件名中沒有明確的版本號時,很難管理本地存儲。
- MTP 性能: 一些用戶報告說,多 token 預測 (MTP) 模組實際上可能會在某些硬體上降低推論速度,例如 M4 Max MacBook Pro。
- Format 請求: 對於與 Apple Silicon 整合更好的 MLX 版本 Qwen3.8-27B 量化版本,存在顯著的需求。
""The one downloaded 3 or 4 days ago is a different thing and is NOT the 'Dynamic 3.0' GGUF which I am now downloading..."" — @walrus01
Sources
相關
- Dispatch
- 專案
- Dispatch
- Dispatch
- Dispatch