z-lab/paroquant

[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

What it solves

ParoQuant 解決了在大型語言模型(LLMs)中使用 INT4 量化時通常會出現的準確度下降問題,尤其是在推理任務上。它旨在減少模型大小與記憶體佔用,同時保持接近原始全精度(FP16)模型的效能。

How it works

此專案實作了 Pairwise Rotation Quantization,利用學習到的成對旋轉來抑制權重異常值。此技術使模型能夠量化至 4 位元(INT4),同時縮小量化版本與原始 FP16 模型之間的準確度差距,且保持與 AWQ 相似的高速推理。

Who it’s for

此框架設計給想要在各種硬體上部署高效能、低延遲 LLM 的開發者與研究者,支援 NVIDIA GPU(透過 vLLM 與 Transformers)以及 Apple Silicon(透過 MLX)。

Highlights

  • High Accuracy: 使 INT4 量化的準確度與 FP16 相當。
  • Cross-Platform Support: 相容於 NVIDIA GPU 與 Apple Silicon。
  • Broad Model Support: 提供 Gemma 4、Qwen、Llama 系列的預先量化檢查點。
  • Flexible Deployment: 包含相容 OpenAI 的 API 伺服器與互動式聊天 CLI。
  • Custom Quantization: 提供工具以最佳化旋轉參數並量化自訂模型。