microsoft/VPTQ
VPTQ, A Flexible and Extreme low-bit quantization algorithm
解決的問題
VPTQ 解決了在無需重新訓練的情況下,將大型語言模型 (LLM) 壓縮至極低位元寬度(2 bits 以下)的挑戰,同時保持高準確度並將推理開銷降至最低。
工作原理
它利用了一種基於向量量化 (Vector Quantization) 的新型訓練後量化 (PTQ) 方法。這種方法允許將巨型模型(例如 Llama-3.1 405B)壓縮至 1-2 bits。該過程設計得非常輕量,量化一個 405B 參數的模型大約需要 17 小時。
適用對象
需要在記憶體有限的硬體上部署巨型 LLM 的 AI 開發人員與研究人員(例如在單個 RTX 4090 上執行 70B 模型),以及尋求低解碼開銷、高吞吐量推理的人員。
亮點
- 極限壓縮:支援將高達 405B 參數的模型壓縮至 2 bits 以下。
- 高效率:輕量級的量化演算法與敏捷的推理,具有優化的首字回應時間 (TTFT) 與吞吐量。
- 廣泛整合:已整合至 Hugging Face Transformers 函式庫中。
- 廣泛的模型支援:相容於包括 Llama 3.1/3.3、DeepSeek R1、Mistral 與 Qwen 在內的各種模型系列。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案