Unsloth Dynamic 3.0 GGUF 发布
Unsloth Dynamic 3.0 在同等尺寸下提供更高的准确率
Unsloth Dynamic v3.0 是对 Dynamic v2.0 的重大升级,专门设计用于在保持相同磁盘占用空间的同时保留更多的模型质量。对于 Qwen3.8-27B 模型,Dynamic 3.0 量化版本在相同尺寸下比其他任何提供商的 top-1% 准确率高出 10% 以上。这些 GGUF 与大多数推理引擎兼容,包括 llama.cpp 和 Unsloth Desktop。
Dynamic 3.0 中的关键技术改进
Dynamic 3.0 通过在训练后量化 (PTQ) 中的几种方法论转变实现了性能提升:
- 高质量校准数据集: Unsloth 现在使用经过改进的 imatrix 校准数据集,该数据集来源于多种渠道,并专门针对多语言性能、对话和智能体编码进行了优化。
- 增强的层选择: 改进了选择哪些层进行量化以及如何进行量化的过程,以最大限度地保留质量。
- 纯 PTQ 方法: Unsloth 明确不使用量化感知训练 (QAT) 或量化感知蒸馏 (QAD),也不在 imatrix 校准数据集上进行训练。与 QAD/QAT 方法相比,这种方法降低了过拟合的风险。
特定模型的优化与尺寸缩减
为了优化磁盘空间和性能,Unsloth 对 Qwen3.8-27B 量化版本实施了特定更改:
- 移除 MTP 模块: 对于
UD-Q2_K_XL以下的较小量化版本 (8.37GB 及以下),移除了 MTP 模块以节省约 500MB 的磁盘空间。需要 MTP 的用户仍可以使用单独的Q4_0MTP 模块。 - 极端压缩:
UD-IQ1_S量化版本为 6.2GB (不含 MTP),在比完整模型小 89% 的情况下,保留了约 72% 的 top-1% 准确率。 - 改进的低比特量化性能:
UD-Q2_K_XL量化版本 (9.83GB) 在 top-1% 准确率上比次优方案高出约 8%,并已证明能够生成以前无法运行的 HTML 程序。
基准测试方法论:Divergence-300 与 KL Divergence
Unsloth 认为标准的 top-1% 准确率 (单个预测的 argmax) 对于衡量实际推理性能是不够的。为了解决这个问题,他们引入了两个主要指标:
Divergence-300 @32
该指标使用来自 Terminal-Bench 2.1、DeepSWE、Harbor 和 MathArena 2025-26 等来源的 300 个示例的留出数据集。该过程涉及对 32 个 token 进行贪婪 argmax 解码,并将量化模型的轨迹与 BF16 (全精度) 版本进行比较。这可以确定量化模型的输出在多个 token 序列中是否与原始模型保持相似,从而比单 token 准确率提供更好的过拟合衡量标准。
KL Divergence (KLD)
Unsloth 将 KL Divergence 视为报告量化误差的金标准,因为它衡量的是“翻转”——即答案从错误变为正确或反之亦然的情况。他们认为困惑度 (perplexity) 是一个错误的指标,因为输出 token 的值可能会相互抵消。为了防止过拟合,Unsloth 在未见过的数据集 (如 Wikitext 和 Code) 上进行 KLD 基准测试,而不是在校准数据集上。
与 Google 的 Gemma 3 QAT 对比
Unsloth 将其 Dynamic 量化版本与 Google 官方的 Gemma 3 量化感知训练 (QAT) 版本进行了基准测试。对于 Gemma 3 (27B) 模型,Unsloth 发现其动态 4-bit 版本比 Google QAT 版本小 2GB,同时在 5-shot MMLU 上提供了 +1% 的额外准确率。
Unsloth 还引入了一个效率指标来评估模型相对于其尺寸的效用:
$$\text{Efficiency} = \frac{\text{MMLU 5-shot score} - 25}{\text{Disk Space GB}}$$
该公式从分数中减去 25,以考虑 4 选 1 MMLU 测试的随机概率基准。
Llama 4 Bug 修复与集成
Unsloth 为开源生态系统贡献了几个关键修复,以提高 Llama 4 的性能:
- RoPE Scaling: 解决了 llama.cpp 中的问题,以支持 Llama 4 Scout RoPE Scaling 配置的更改。
- QK Norm Epsilon: 修复了 llama.cpp 和 transformers 中 Scout 和 Maverick 的 QK Norm epsilon,确保其使用 1e-05 而不是 1e-06。
- QK Norm Sharing: 与 Llama 4 团队和 vLLM 协作,修复了一个 QK Norm 在所有 head 之间共享的问题,该问题将 MMLU Pro 准确率从 68.58% 提高到了 71.53%。
社区洞察与反馈
围绕此次发布的社区讨论突出了几个实际问题和请求:
- 版本控制: 用户指出 GGUF 文件在不同版本之间经常使用相同的名称 (例如,Dynamic 2.0 与 3.0),这使得在文件名中没有明确的版本号时,很难管理本地存储。
- MTP 性能: 一些用户报告说, Multi-Token Prediction (MTP) 模块在某些硬件上 (例如 M4 Max MacBook Pro) 实际上会减慢推理速度。
- 格式请求: 对于 Qwen3.8-27B 量化版本的 MLX 格式,存在显著的需求,以便更好地与 Apple Silicon 集成。
""The one downloaded 3 or 4 days ago is a different thing and is NOT the 'Dynamic 3.0' GGUF which I am now downloading..."" — @walrus01
Sources
相关
- Dispatch
- 项目
- Dispatch
- Dispatch
- Dispatch