FutureMLS-Lab/OSCAR

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

解決的問題

OSCAR 解決了大語言模型中 KV(鍵-值)快取所帶來的高記憶體開銷問題,此問題通常會限制上下文長度與吞吐量。它能在維持接近原始 16 位(BF16)精度的前提下,實現 KV 快取的 2 位量化(INT2),尤其在其他 2 位方法通常失效的複雜推理與程式設計任務中表現優異。

工作原理

OSCAR 使用離線校準過程分析模型實際如何使用其注意力機制。它在小資料集上捕獲激活值,以估計鍵與值的「注意力感知」共變異結構。基於這些結構,推導出每層的正交旋轉與裁剪閾值,使量化過程與模型最需要的精度方向對齊。

為進一步保護品質,採用混合精度策略:一小部分「初始令牌」與最近的令牌視窗以 BF16 保留,而快取的大部分則以 INT2 存儲。該策略透過融合混合精度的 Flash-Attention 內核實現,以確保高效率。

適用對象

  • LLM 部署者:希望在硬體受限的情況下將 KV 快取記憶體減少約 8 倍,以支援更長的上下文或更大的批次大小。
  • 本地 LLM 使用者:在消費級硬體(如 MacBook)上運行模型,希望在長上下文視窗下執行大型模型(如 Qwen3-32B)的使用者。
  • 機器學習研究人員:從事 KV 快取量化與高效推理引擎開發的開發者。

主要亮點

  • 極致壓縮:相比 BF16,KV 快取記憶體減少約 8 倍。
  • 性能提升:在大批次下吞吐量最高提升 7 倍,在單批次解碼時最高提速 3 倍。
  • 框架整合:已整合至 SGLang 和 llama.cpp(透過特定分支)。
  • 高保真度:在推理基準(GPQA、HumanEval)上保持接近 BF16 的品質,而純粹 2 位量化通常會崩潰。
  • 旋轉資料庫:於 Hugging Face 提供預計算的校準旋轉,使用者可跳過校準階段。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch