z-lab/paroquant

[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference

何を解決するか

ParoQuantは、大規模言語モデル(LLMs)におけるINT4量子化で通常見られる精度の低下を解決します。特に推論タスクにおいて、低精度(INT4)と高精度(FP16)モデルの性能ギャップを埋め、高い推論速度を維持します。

動作方法

本プロジェクトは、学習されたペアワイズ回転を使用して重みの外れ値を抑制する「ペアワイズ回転量子化」を実装しています。この技術により、従来の量子化手法で見られる顕著な精度低下を回避しながら、モデルを4ビット精度に圧縮できます。

対象ユーザー

NVIDIA GPU(vLLMおよびTransformers経由)またはApple Silicon(MLX経由)を使用する、限られたハードウェア上で大規模モデルを効率的に実行したい開発者や研究者向けです。

特徴

  • 高い効率性:AWQと同等の速度で動作します。
  • 広範なハードウェア対応:NVIDIA GPUとApple Siliconに対応しています。
  • 事前量子化モデル:Hugging Face上で、Qwen、Gemma、LlamaモデルのParoQuant最適化版を多数提供しています。
  • カスタム量子化:回転パラメータの最適化ツールと、既存モデルをParoQuantチェックポイントに変換するためのツールを備えています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト