z-lab/paroquant
[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
解決的問題
ParoQuant 解決了大語言模型(LLMs)在 INT4 量化過程中通常伴隨的精度損失問題,特別是在推理任務中。它旨在縮小低精度(INT4)與高精度(FP16)模型之間的性能差距,同時保持高推理速度。
工作原理
本專案實作了成對旋轉量化(Pairwise Rotation Quantization),透過學習得到的成對旋轉來抑制權重異常值。此技術使模型能在不產生傳統量化方法中常見的顯著精度下降的情況下,壓縮至 4 位元精度。
適用對象
專為需要在有限硬體上高效運行大模型的開發者與研究人員設計,特別是使用 NVIDIA GPU(透過 vLLM 和 Transformers)或 Apple Silicon(透過 MLX)的使用者。
核心亮點
- 高效率:運行速度與 AWQ 相當。
- 廣泛硬體支援:相容 NVIDIA GPU 與 Apple Silicon。
- 預量化模型:在 Hugging Face 上提供大量 Qwen、Gemma 和 Llama 模型的 ParoQuant 優化版本。
- 自訂量化:包含優化旋轉參數的工具,以及將現有模型轉換為 ParoQuant 檢查點的工具。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案