microsoft/VPTQ
VPTQ, A Flexible and Extreme low-bit quantization algorithm
解决的问题
VPTQ 解决了在无需重新训练的情况下,将大语言模型 (LLM) 压缩至极低位宽(2 bit 以下)的挑战,同时保持高准确度并最大限度地减少推理开销。
工作原理
它利用了一种基于矢量量化 (Vector Quantization) 的新型训练后量化 (PTQ) 方法。这种方法允许将巨型模型(如 Llama-3.1 405B)压缩至 1-2 bit。该过程设计得非常轻量,量化一个 405B 参数的模型大约需要 17 小时。
适用对象
需要在内存有限的硬件上部署巨型 LLM 的 AI 开发人员和研究人员(例如在单个 RTX 4090 上运行 70B 模型),以及寻求低解码开销、高吞吐量推理的人员。
亮点
- 极限压缩:支持将高达 405B 参数的模型压缩至 2 bit 以下。
- 高效率:轻量级的量化算法和敏捷的推理,具有优化的首字响应时间 (TTFT) 和吞吐量。
- 广泛集成:已集成到 Hugging Face Transformers 库中。
- 广泛的模型支持:兼容包括 Llama 3.1/3.3、DeepSeek R1、Mistral 和 Qwen 在内的多种模型系列。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目