量化感知修復使 4 位元 LLM 的表現超越其完整精度原始模型
簡要說明
量化感知修復(QAH)將 120B 參數的 GPT‑OSS 模型壓縮至 60B 參數與 4 位元 MXFP4 精度,且該模型在 9 個基準中的 7 個上表現優於其完整精度的 bfloat16 對應模型,證明 4 位元模型不僅更便宜,還能更準確。
為何傳統修復方法在結構壓縮後失效
- 傳統流程先壓縮架構,再量化權重,最後執行修復步驟。
- 量化感知訓練(QAT) 加入偽量化運算子並在任務損失上微調。此方法成本高昂,若訓練超過最佳點,可能變得不穩定。
- 量化感知蒸餾(QAD) 使用 KL 散度,將完整精度的教師模型蒸餾至量化學生模型。此方法僅在教師與學生架構相同時有效;結構壓縮後,較小架構的完整精度版本不存在,因此教師模型為退化的恢復檢查點,限制了準確度。
- 結果,學界缺乏一種能修復已同時進行結構壓縮與量化的模型的方法。
量化感知修復(QAH)配方
- QAH 直接從原始、未壓縮模型(120B 教師)蒸餾至壓縮後的 4 位元學生模型,即使兩者架構不同。
- 學生模型僅接收教師模型的輸出分佈,透過 logits 上的 KL 散度進行匹配——不使用硬標籤。
- 此方法將量化視為第二階段蒸餾,而非損失性後處理步驟,使學生模型能獲取先前恢復過程中遺漏的資訊。
- 基於 KL 的蒸餾提供穩定性:一旦學生模型匹配固定教師分佈,便無需漂移,與可能導致退化的交叉熵任務損失不同。
- 對於長上下文修復(最多 32k token),QAH 重用記憶體效率高的分塊 KL 散度損失,一次處理一個片段,可在固定 GPU 記憶體預算內運行。

圖 1:QAH 透過從原始模型蒸餾,而非恢復檢查點,恢復效能。
針對 60B 參數 4 位元模型的實證結果
QAH 流程應用於壓縮至 60B 參數的 GPT‑OSS 120B 模型,恢復為 bfloat16,再重新量化至 MXFP4。效能與相同 60B bfloat16 檢查點及原始 120B 教師模型進行比較。
| 基準 | 120B 教師(MXFP4) | 60B BF16(恢復) | 60B MXFP4(QAH) | QAH 對 BF16 |
|---|---|---|---|---|
| AA‑LCR(長上下文推理) | 50.0 | 35.3 | 42.7 | +7.4 |
| AIME 2025(數學) | 80.0 | 70.7 | 76.3 | +5.6 |
| Aider(代理式程式設計) | 45.3 | 38.2 | 40.9 | +2.7 |
| τ²‑bench(工具使用) | 68.4 | 59.4 | 61.7 | +2.3 |
| GPQA Diamond(科學) | 69.0 | 65.7 | 67.4 | +1.7 |
| IFBench(指令遵循) | 63.3 | 58.4 | 59.9 | +1.5 |
| LiveCodeBench(程式設計) | 66.0 | 65.5 | 66.5 | +1.0 |
| MMLU‑Pro(知識) | 78.0 | 74.0 | 73.8 | –0.2 |
| SciCode(科學程式設計) | 37.5 | 35.6 | 34.2 | –1.4 |
- 4 位元 QAH 模型在 9 個基準中的 7 個上超越其自身 bfloat16 原始模型。
- 壓縮對最嚴重受損的任務提升最大:長上下文推理(+7.4)與數學(+5.6)。
- 對比原始 120B 教師模型,QAH 模型在 LiveCodeBench 上匹配或超越表現,且在 GPQA Diamond 上僅落後 1.6 點,儘管參數量僅為一半,權重記憶體約為四分之一。

圖 2:QAH 模型在大多數基準上匹配或超越其 bfloat16 原始模型,並與完整大小教師模型競爭密切。
QAH 對 QAT:速度與穩定性比較
- 實驗:將 GPT‑OSS 9B 模型量化至 MXFP4,並以 QAH 或 QAT 訓練。
- 最高準確度:QAH 達 54.9,QAT 達 54.6——幾乎持平。
- 訓練效率:QAH 在約 100 步內達峰值(約比 QAT 的 700 步快 7 倍)。
- 穩定性:QAH 在 1,200 步內保持在峰值附近約 2 點內;QAT 崩潰,峰值後損失約 19 點。
- 實際影響:QAT 需要小心的早期停止以避免退化,而完全訓練的 QAH 檢查點可安全部署,無漂移風險。

圖 3:QAH 實現快速收斂並保持穩定,與 QAT 在峰值後退化形成對比。
對部署的實際影響
- 記憶體效率:4 位元精度相比 bfloat16 可減少約 4 倍的權重記憶體。
- 計算量減少:參數數量減半可大致減半每 token 的計算量;結合 4 位元精度,有效計算成本可比 bfloat16 基準降低最多 8 倍。
- 成本-效能權衡:以 QAH 訓練的 4 位元模型在需要更小硬體的情況下提供更高準確度,使量化從效能稅轉變為額外的學習訊號。
- 工作流程簡化:QAH 消除了量化後重複執行完整多階段後訓練流程(監督微調、RLHF、代理式調校)的需求,節省時間與計算資源。
未來方向
- 此方法是 Multiverse Computing 為使大型模型更便宜而不犧牲效能所推動的廣泛努力的一部分,補充其在長上下文訓練高效知識蒸餾方面的研究。
- 開放問題包括將 QAH 擴展至更大模型、探索替代的教師-學生架構,以及將 QAH 與其他效率技術(如稀疏性或專家混合)整合。
完整的技術細節,包括分塊 KL 實作與分散式訓練發現,可在論文中取得: https://huggingface.co/papers/2608.20953。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch