z-lab/paroquant

[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

解决的问题

ParoQuant 解决了大语言模型(LLMs)在 INT4 量化过程中通常伴随的精度损失问题,特别是在推理任务中。它旨在缩小低精度(INT4)与高精度(FP16)模型之间的性能差距,同时保持高推理速度。

工作原理

该项目实现了成对旋转量化(Pairwise Rotation Quantization),通过学习得到的成对旋转来抑制权重异常值。该技术使模型能够在不出现传统量化方法中常见的显著精度下降的情况下,压缩至 4 位精度。

适用人群

专为需要在有限硬件上高效运行大模型的开发者和研究人员设计,特别是使用 NVIDIA GPU(通过 vLLM 和 Transformers)或 Apple Silicon(通过 MLX)的用户。

核心亮点

  • 高效率:运行速度与 AWQ 相当。
  • 广泛硬件支持:兼容 NVIDIA GPU 和 Apple Silicon。
  • 预量化模型:在 Hugging Face 上提供大量 Qwen、Gemma 和 Llama 模型的 ParoQuant 优化版本。
  • 自定义量化:包含优化旋转参数的工具,以及将现有模型转换为 ParoQuant 检查点的工具。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目