量化感知修复使4位LLM性能超越其全精度原始模型

概要

量化感知修复(QAH)将一个1200亿参数的GPT‑OSS模型压缩至600亿参数和4位MXFP4精度,结果模型在9个基准测试中的7个上表现优于其全精度bfloat16对应模型,证明4位模型不仅能更便宜,还能更准确。

传统修复方法在结构压缩后失效的原因

  • 传统流程先压缩架构,再量化权重,最后进行修复步骤。
  • 量化感知训练(QAT) 添加伪量化操作符并在任务损失上微调。该方法成本高,若训练超过最优点可能变得不稳定。
  • 量化感知蒸馏(QAD) 使用KL散度将全精度教师模型蒸馏到量化学生模型。此方法仅在教师与学生架构相同时有效;结构压缩后,小架构的全精度版本不存在,因此教师模型只能是退化的恢复检查点,限制了准确率上限。
  • 因此,该领域缺乏一种能够修复经过结构压缩和量化后的模型的方法。

量化感知修复(QAH)方案

  • QAH 直接从原始预压缩模型(1200亿参数教师模型)蒸馏到压缩后的4位学生模型,尽管两者架构不同。
  • 学生模型仅接收教师模型的输出分布,通过logits上的KL散度进行匹配——不使用硬标签。
  • 此方法将量化视为第二次蒸馏过程,而非有损后处理步骤,使学生模型能获取早期恢复过程中遗漏的信息。
  • 基于KL的蒸馏提供稳定性:一旦学生模型匹配冻结的教师分布,就不会有漂移压力,而交叉熵任务损失可能导致性能下降。
  • 对于长上下文修复(最多32k token),QAH复用一种内存高效的分块KL散度损失,逐片处理,可在固定GPU内存预算内运行。

QAH概览:结构压缩和量化后,模型能力急剧下降。QAH从原始预压缩模型作为冻结教师进行蒸馏,恢复性能,无需重新执行多阶段后训练。

图1:QAH通过从原始模型蒸馏而非恢复检查点来恢复性能。

600亿参数4位模型的实证结果

QAH流程应用于将GPT‑OSS 1200亿模型压缩至600亿参数,恢复为bfloat16,再重新量化为MXFP4。性能与相同600亿bfloat16检查点及原始1200亿教师模型进行对比。

基准测试 1200亿教师(MXFP4) 600亿 BF16(恢复) 600亿 MXFP4(QAH) QAH vs BF16
AA‑LCR(长上下文推理) 50.0 35.3 42.7 +7.4
AIME 2025(数学) 80.0 70.7 76.3 +5.6
Aider(代理编码) 45.3 38.2 40.9 +2.7
τ²‑bench(工具使用) 68.4 59.4 61.7 +2.3
GPQA Diamond(科学) 69.0 65.7 67.4 +1.7
IFBench(指令遵循) 63.3 58.4 59.9 +1.5
LiveCodeBench(编码) 66.0 65.5 66.5 +1.0
MMLU‑Pro(知识) 78.0 74.0 73.8 –0.2
SciCode(科学编码) 37.5 35.6 34.2 –1.4
  • 4位QAH模型在9个基准测试中的7个上优于其自身的bfloat16源模型。
  • 在压缩最严重损害的任务上增益最大:长上下文推理(+7.4)和数学(+5.6)。
  • 与原始1200亿教师模型相比,QAH模型在LiveCodeBench上匹配或超越性能,在GPQA Diamond上仅落后1.6分,尽管参数量减半,权重内存约为全精度基线的四分之一。

三个检查点的基准性能对比:原始GPT‑OSS‑1200亿教师(MXFP4)、压缩并恢复的600亿模型(bfloat16),以及使用QAH重新量化为MXFP4的相同600亿模型,在九个基准测试上的表现。

图2:QAH模型在大多数基准测试上匹配或超越其bfloat16源模型,并与全尺寸教师模型竞争激烈。

QAH vs. QAT:速度与稳定性对比

  • 实验:将GPT‑OSS 90亿模型量化至MXFP4,并使用QAH或QAT进行训练。
  • 峰值准确率:QAH达到54.9,QAT达到54.6——基本持平。
  • 训练效率:QAH在约100步后达到峰值(约比QAT的700步快7倍)。
  • 稳定性:QAH在1200步内保持在峰值附近约2分以内;QAT在峰值后崩溃,损失约19分。
  • 实际影响:QAT需要谨慎早停以避免性能下降,而完全训练的QAH检查点可安全部署,无漂移风险。

QAH与QAT在训练过程中平均性能对比,将GPT‑OSS 90亿模型量化至MXFP4。QAH早期达到峰值并保持稳定;QAT稍晚达到相近峰值,随后崩溃。

图3:QAH实现快速收敛并保持稳定,而QAT在峰值后出现退化。

部署的实际意义

  • 内存效率:4位精度相比bfloat16将权重内存减少约4倍。
  • 计算量降低:参数量减半大致使每token计算量减半;结合4位精度,有效计算成本可比bfloat16基线降低最多8倍。
  • 成本-性能权衡:QAH训练的4位模型在硬件需求更小的同时实现更高准确率,使量化从性能税转变为额外的学习信号。
  • 流程简化:QAH消除了量化后重新运行完整多阶段后训练流程(监督微调、RLHF、代理调优)的需要,节省时间和计算资源。

未来方向

  • 该方法是Multiverse Computing推动大模型更低成本化努力的一部分,与他们在长上下文训练高效知识蒸馏方面的研究相辅相成。
  • 开放问题包括将QAH扩展至更大模型、探索替代的师生架构组合,以及将QAH与其他效率技术(如稀疏性或专家混合)集成。

完整技术细节(包括分块KL实现和分布式训练发现)可在论文中获取https://huggingface.co/papers/2608.20953。


Sources

相关