FutureMLS-Lab/OSCAR
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
解決的問題
OSCAR 解決了大語言模型中 KV(鍵-值)快取所帶來的高記憶體開銷問題,此問題通常會限制上下文長度與吞吐量。它能在維持接近原始 16 位(BF16)精度的前提下,實現 KV 快取的 2 位量化(INT2),尤其在其他 2 位方法通常失效的複雜推理與程式設計任務中表現優異。
工作原理
OSCAR 使用離線校準過程分析模型實際如何使用其注意力機制。它在小資料集上捕獲激活值,以估計鍵與值的「注意力感知」共變異結構。基於這些結構,推導出每層的正交旋轉與裁剪閾值,使量化過程與模型最需要的精度方向對齊。
為進一步保護品質,採用混合精度策略:一小部分「初始令牌」與最近的令牌視窗以 BF16 保留,而快取的大部分則以 INT2 存儲。該策略透過融合混合精度的 Flash-Attention 內核實現,以確保高效率。
適用對象
- LLM 部署者:希望在硬體受限的情況下將 KV 快取記憶體減少約 8 倍,以支援更長的上下文或更大的批次大小。
- 本地 LLM 使用者:在消費級硬體(如 MacBook)上運行模型,希望在長上下文視窗下執行大型模型(如 Qwen3-32B)的使用者。
- 機器學習研究人員:從事 KV 快取量化與高效推理引擎開發的開發者。
主要亮點
- 極致壓縮:相比 BF16,KV 快取記憶體減少約 8 倍。
- 性能提升:在大批次下吞吐量最高提升 7 倍,在單批次解碼時最高提速 3 倍。
- 框架整合:已整合至 SGLang 和 llama.cpp(透過特定分支)。
- 高保真度:在推理基準(GPQA、HumanEval)上保持接近 BF16 的品質,而純粹 2 位量化通常會崩潰。
- 旋轉資料庫:於 Hugging Face 提供預計算的校準旋轉,使用者可跳過校準階段。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch