量化感知修復使 4 位元 LLM 的表現超越其完整精度原始模型

簡要說明

量化感知修復(QAH)將 120B 參數的 GPT‑OSS 模型壓縮至 60B 參數與 4 位元 MXFP4 精度,且該模型在 9 個基準中的 7 個上表現優於其完整精度的 bfloat16 對應模型,證明 4 位元模型不僅更便宜,還能更準確。

為何傳統修復方法在結構壓縮後失效

  • 傳統流程先壓縮架構,再量化權重,最後執行修復步驟。
  • 量化感知訓練(QAT) 加入偽量化運算子並在任務損失上微調。此方法成本高昂,若訓練超過最佳點,可能變得不穩定。
  • 量化感知蒸餾(QAD) 使用 KL 散度,將完整精度的教師模型蒸餾至量化學生模型。此方法僅在教師與學生架構相同時有效;結構壓縮後,較小架構的完整精度版本不存在,因此教師模型為退化的恢復檢查點,限制了準確度。
  • 結果,學界缺乏一種能修復已同時進行結構壓縮與量化的模型的方法。

量化感知修復(QAH)配方

  • QAH 直接從原始、未壓縮模型(120B 教師)蒸餾至壓縮後的 4 位元學生模型,即使兩者架構不同。
  • 學生模型僅接收教師模型的輸出分佈,透過 logits 上的 KL 散度進行匹配——不使用硬標籤。
  • 此方法將量化視為第二階段蒸餾,而非損失性後處理步驟,使學生模型能獲取先前恢復過程中遺漏的資訊。
  • 基於 KL 的蒸餾提供穩定性:一旦學生模型匹配固定教師分佈,便無需漂移,與可能導致退化的交叉熵任務損失不同。
  • 對於長上下文修復(最多 32k token),QAH 重用記憶體效率高的分塊 KL 散度損失,一次處理一個片段,可在固定 GPU 記憶體預算內運行。

QAH 概覽:結構壓縮與量化後,效能急劇下降。QAH 從原始未壓縮模型作為固定教師進行蒸餾,恢復效能,無需重複多階段後訓練。

圖 1:QAH 透過從原始模型蒸餾,而非恢復檢查點,恢復效能。

針對 60B 參數 4 位元模型的實證結果

QAH 流程應用於壓縮至 60B 參數的 GPT‑OSS 120B 模型,恢復為 bfloat16,再重新量化至 MXFP4。效能與相同 60B bfloat16 檢查點及原始 120B 教師模型進行比較。

基準 120B 教師(MXFP4) 60B BF16(恢復) 60B MXFP4(QAH) QAH 對 BF16
AA‑LCR(長上下文推理) 50.0 35.3 42.7 +7.4
AIME 2025(數學) 80.0 70.7 76.3 +5.6
Aider(代理式程式設計) 45.3 38.2 40.9 +2.7
τ²‑bench(工具使用) 68.4 59.4 61.7 +2.3
GPQA Diamond(科學) 69.0 65.7 67.4 +1.7
IFBench(指令遵循) 63.3 58.4 59.9 +1.5
LiveCodeBench(程式設計) 66.0 65.5 66.5 +1.0
MMLU‑Pro(知識) 78.0 74.0 73.8 –0.2
SciCode(科學程式設計) 37.5 35.6 34.2 –1.4
  • 4 位元 QAH 模型在 9 個基準中的 7 個上超越其自身 bfloat16 原始模型。
  • 壓縮對最嚴重受損的任務提升最大:長上下文推理(+7.4)與數學(+5.6)。
  • 對比原始 120B 教師模型,QAH 模型在 LiveCodeBench 上匹配或超越表現,且在 GPQA Diamond 上僅落後 1.6 點,儘管參數量僅為一半,權重記憶體約為四分之一。

三個檢查點的基準效能:原始 GPT‑OSS‑120B 教師(MXFP4)、壓縮並恢復的 60B 模型(bfloat16),以及相同 60B 模型以 QAH 重新量化至 MXFP4,涵蓋九個基準。

圖 2:QAH 模型在大多數基準上匹配或超越其 bfloat16 原始模型,並與完整大小教師模型競爭密切。

QAH 對 QAT:速度與穩定性比較

  • 實驗:將 GPT‑OSS 9B 模型量化至 MXFP4,並以 QAH 或 QAT 訓練。
  • 最高準確度:QAH 達 54.9,QAT 達 54.6——幾乎持平。
  • 訓練效率:QAH 在約 100 步內達峰值(約比 QAT 的 700 步快 7 倍)。
  • 穩定性:QAH 在 1,200 步內保持在峰值附近約 2 點內;QAT 崩潰,峰值後損失約 19 點。
  • 實際影響:QAT 需要小心的早期停止以避免退化,而完全訓練的 QAH 檢查點可安全部署,無漂移風險。

QAH 與 QAT 在訓練過程中平均效能,將 GPT‑OSS 9B 量化至 MXFP4。QAH 早期達峰值並保持穩定;QAT 稍後達相近峰值,隨後崩潰。

圖 3:QAH 實現快速收斂並保持穩定,與 QAT 在峰值後退化形成對比。

對部署的實際影響

  • 記憶體效率:4 位元精度相比 bfloat16 可減少約 4 倍的權重記憶體。
  • 計算量減少:參數數量減半可大致減半每 token 的計算量;結合 4 位元精度,有效計算成本可比 bfloat16 基準降低最多 8 倍。
  • 成本-效能權衡:以 QAH 訓練的 4 位元模型在需要更小硬體的情況下提供更高準確度,使量化從效能稅轉變為額外的學習訊號。
  • 工作流程簡化:QAH 消除了量化後重複執行完整多階段後訓練流程(監督微調、RLHF、代理式調校)的需求,節省時間與計算資源。

未來方向

  • 此方法是 Multiverse Computing 為使大型模型更便宜而不犧牲效能所推動的廣泛努力的一部分,補充其在長上下文訓練高效知識蒸餾方面的研究。
  • 開放問題包括將 QAH 擴展至更大模型、探索替代的教師-學生架構,以及將 QAH 與其他效率技術(如稀疏性或專家混合)整合。

完整的技術細節,包括分塊 KL 實作與分散式訓練發現,可在論文中取得https://huggingface.co/papers/2608.20953。


Sources

相關