量化感知修复使4位LLM性能超越其全精度原始模型
概要
量化感知修复(QAH)将一个1200亿参数的GPT‑OSS模型压缩至600亿参数和4位MXFP4精度,结果模型在9个基准测试中的7个上表现优于其全精度bfloat16对应模型,证明4位模型不仅能更便宜,还能更准确。
传统修复方法在结构压缩后失效的原因
- 传统流程先压缩架构,再量化权重,最后进行修复步骤。
- 量化感知训练(QAT) 添加伪量化操作符并在任务损失上微调。该方法成本高,若训练超过最优点可能变得不稳定。
- 量化感知蒸馏(QAD) 使用KL散度将全精度教师模型蒸馏到量化学生模型。此方法仅在教师与学生架构相同时有效;结构压缩后,小架构的全精度版本不存在,因此教师模型只能是退化的恢复检查点,限制了准确率上限。
- 因此,该领域缺乏一种能够修复经过结构压缩和量化后的模型的方法。
量化感知修复(QAH)方案
- QAH 直接从原始预压缩模型(1200亿参数教师模型)蒸馏到压缩后的4位学生模型,尽管两者架构不同。
- 学生模型仅接收教师模型的输出分布,通过logits上的KL散度进行匹配——不使用硬标签。
- 此方法将量化视为第二次蒸馏过程,而非有损后处理步骤,使学生模型能获取早期恢复过程中遗漏的信息。
- 基于KL的蒸馏提供稳定性:一旦学生模型匹配冻结的教师分布,就不会有漂移压力,而交叉熵任务损失可能导致性能下降。
- 对于长上下文修复(最多32k token),QAH复用一种内存高效的分块KL散度损失,逐片处理,可在固定GPU内存预算内运行。

图1:QAH通过从原始模型蒸馏而非恢复检查点来恢复性能。
600亿参数4位模型的实证结果
QAH流程应用于将GPT‑OSS 1200亿模型压缩至600亿参数,恢复为bfloat16,再重新量化为MXFP4。性能与相同600亿bfloat16检查点及原始1200亿教师模型进行对比。
| 基准测试 | 1200亿教师(MXFP4) | 600亿 BF16(恢复) | 600亿 MXFP4(QAH) | QAH vs BF16 |
|---|---|---|---|---|
| AA‑LCR(长上下文推理) | 50.0 | 35.3 | 42.7 | +7.4 |
| AIME 2025(数学) | 80.0 | 70.7 | 76.3 | +5.6 |
| Aider(代理编码) | 45.3 | 38.2 | 40.9 | +2.7 |
| τ²‑bench(工具使用) | 68.4 | 59.4 | 61.7 | +2.3 |
| GPQA Diamond(科学) | 69.0 | 65.7 | 67.4 | +1.7 |
| IFBench(指令遵循) | 63.3 | 58.4 | 59.9 | +1.5 |
| LiveCodeBench(编码) | 66.0 | 65.5 | 66.5 | +1.0 |
| MMLU‑Pro(知识) | 78.0 | 74.0 | 73.8 | –0.2 |
| SciCode(科学编码) | 37.5 | 35.6 | 34.2 | –1.4 |
- 4位QAH模型在9个基准测试中的7个上优于其自身的bfloat16源模型。
- 在压缩最严重损害的任务上增益最大:长上下文推理(+7.4)和数学(+5.6)。
- 与原始1200亿教师模型相比,QAH模型在LiveCodeBench上匹配或超越性能,在GPQA Diamond上仅落后1.6分,尽管参数量减半,权重内存约为全精度基线的四分之一。

图2:QAH模型在大多数基准测试上匹配或超越其bfloat16源模型,并与全尺寸教师模型竞争激烈。
QAH vs. QAT:速度与稳定性对比
- 实验:将GPT‑OSS 90亿模型量化至MXFP4,并使用QAH或QAT进行训练。
- 峰值准确率:QAH达到54.9,QAT达到54.6——基本持平。
- 训练效率:QAH在约100步后达到峰值(约比QAT的700步快7倍)。
- 稳定性:QAH在1200步内保持在峰值附近约2分以内;QAT在峰值后崩溃,损失约19分。
- 实际影响:QAT需要谨慎早停以避免性能下降,而完全训练的QAH检查点可安全部署,无漂移风险。

图3:QAH实现快速收敛并保持稳定,而QAT在峰值后出现退化。
部署的实际意义
- 内存效率:4位精度相比bfloat16将权重内存减少约4倍。
- 计算量降低:参数量减半大致使每token计算量减半;结合4位精度,有效计算成本可比bfloat16基线降低最多8倍。
- 成本-性能权衡:QAH训练的4位模型在硬件需求更小的同时实现更高准确率,使量化从性能税转变为额外的学习信号。
- 流程简化:QAH消除了量化后重新运行完整多阶段后训练流程(监督微调、RLHF、代理调优)的需要,节省时间和计算资源。
未来方向
- 该方法是Multiverse Computing推动大模型更低成本化努力的一部分,与他们在长上下文训练高效知识蒸馏方面的研究相辅相成。
- 开放问题包括将QAH扩展至更大模型、探索替代的师生架构组合,以及将QAH与其他效率技术(如稀疏性或专家混合)集成。
完整技术细节(包括分块KL实现和分布式训练发现)可在论文中获取: https://huggingface.co/papers/2608.20953。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch