microsoft/VPTQ

VPTQ, A Flexible and Extreme low-bit quantization algorithm

解決的問題

VPTQ 解決了在無需重新訓練的情況下,將大型語言模型 (LLM) 壓縮至極低位元寬度(2 bits 以下)的挑戰,同時保持高準確度並將推理開銷降至最低。

工作原理

它利用了一種基於向量量化 (Vector Quantization) 的新型訓練後量化 (PTQ) 方法。這種方法允許將巨型模型(例如 Llama-3.1 405B)壓縮至 1-2 bits。該過程設計得非常輕量,量化一個 405B 參數的模型大約需要 17 小時。

適用對象

需要在記憶體有限的硬體上部署巨型 LLM 的 AI 開發人員與研究人員(例如在單個 RTX 4090 上執行 70B 模型),以及尋求低解碼開銷、高吞吐量推理的人員。

亮點

  • 極限壓縮:支援將高達 405B 參數的模型壓縮至 2 bits 以下。
  • 高效率:輕量級的量化演算法與敏捷的推理,具有優化的首字回應時間 (TTFT) 與吞吐量。
  • 廣泛整合:已整合至 Hugging Face Transformers 函式庫中。
  • 廣泛的模型支援:相容於包括 Llama 3.1/3.3、DeepSeek R1、Mistral 與 Qwen 在內的各種模型系列。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案