FutureMLS-Lab/OSCAR
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
解决的问题
OSCAR 解决了大语言模型中 KV(键-值)缓存带来的高内存开销问题,该问题通常会限制上下文长度和吞吐量。它能够在保持接近原始 16 位(BF16)精度的前提下,实现 KV 缓存的 2 位量化(INT2),尤其在其他 2 位方法通常失效的复杂推理和编程任务中表现优异。
工作原理
OSCAR 使用离线校准过程分析模型实际如何使用其注意力机制。它在小数据集上捕获激活值,以估计键和值的“注意力感知”协方差结构。基于这些结构,推导出每层的正交旋转和裁剪阈值,使量化过程与模型最需要的精度方向对齐。
为进一步保护质量,采用混合精度策略:一小部分“初始令牌”和最近的令牌窗口以 BF16 保留,而缓存的大部分则以 INT2 存储。该策略通过融合混合精度的 Flash-Attention 内核实现,以保证高性能。
适用人群
- LLM 部署者:希望在硬件受限的情况下将 KV 缓存内存减少约 8 倍,以支持更长的上下文或更大的批处理大小。
- 本地 LLM 用户:在消费级硬件(如 MacBook)上运行模型,希望在长上下文窗口下运行大型模型(如 Qwen3-32B)的用户。
- 机器学习研究人员:从事 KV 缓存量化和高效推理引擎开发的开发者。
主要亮点
- 极致压缩:相比 BF16,KV 缓存内存减少约 8 倍。
- 性能提升:在大批次下吞吐量最高提升 7 倍,在单批次解码时最高提速 3 倍。
- 框架集成:已集成至 SGLang 和 llama.cpp(通过特定分支)。
- 高保真度:在推理基准(GPQA、HumanEval)上保持接近 BF16 的质量,而朴素 2 位量化通常会崩溃。
- 旋转库:在 Hugging Face 上提供预计算的校准旋转,用户可跳过校准阶段。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch