microsoft/VPTQ

VPTQ, A Flexible and Extreme low-bit quantization algorithm

解决的问题

VPTQ 解决了在无需重新训练的情况下,将大语言模型 (LLM) 压缩至极低位宽(2 bit 以下)的挑战,同时保持高准确度并最大限度地减少推理开销。

工作原理

它利用了一种基于矢量量化 (Vector Quantization) 的新型训练后量化 (PTQ) 方法。这种方法允许将巨型模型(如 Llama-3.1 405B)压缩至 1-2 bit。该过程设计得非常轻量,量化一个 405B 参数的模型大约需要 17 小时。

适用对象

需要在内存有限的硬件上部署巨型 LLM 的 AI 开发人员和研究人员(例如在单个 RTX 4090 上运行 70B 模型),以及寻求低解码开销、高吞吐量推理的人员。

亮点

  • 极限压缩:支持将高达 405B 参数的模型压缩至 2 bit 以下。
  • 高效率:轻量级的量化算法和敏捷的推理,具有优化的首字响应时间 (TTFT) 和吞吐量。
  • 广泛集成:已集成到 Hugging Face Transformers 库中。
  • 广泛的模型支持:兼容包括 Llama 3.1/3.3、DeepSeek R1、Mistral 和 Qwen 在内的多种模型系列。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目