z-lab/paroquant
[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
What it solves
ParoQuant 解决了在大型语言模型(LLMs)中使用 INT4 量化时通常会出现的准确度下降问题,尤其是在推理任务上。它旨在减少模型大小与内存占用,同时保持接近原始全精度(FP16)模型的性能。
How it works
此项目实现了 Pairwise Rotation Quantization,利用学习到的成对旋转来抑制权重异常值。此技术使模型能够量化至 4 位(INT4),同时缩小量化版本与原始 FP16 模型之间的准确度差距,并保持与 AWQ 相似的高速推理。
Who it’s for
此框架设计给想要在各种硬件上部署高效、低延迟 LLM 的开发者和研究者,支持 NVIDIA GPU(通过 vLLM 与 Transformers)以及 Apple Silicon(通过 MLX)。
Highlights
- High Accuracy: 使 INT4 量化的准确度与 FP16 相当。
- Cross-Platform Support: 兼容 NVIDIA GPU 与 Apple Silicon。
- Broad Model Support: 提供 Gemma 4、Qwen、Llama 系列的预先量化检查点。
- Flexible Deployment: 包含兼容 OpenAI 的 API 服务器与交互式聊天 CLI。
- Custom Quantization: 提供工具以优化旋转参数并量化自定义模型。