z-lab/paroquant
[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
What it solves
ParoQuant은 특히 추론 작업에서 대형 언어 모델(LLM)의 INT4 양자화와 관련된 정확도 손실을 해결합니다. 모델 크기와 메모리 사용량을 줄이면서 원본 풀 프리시전(FP16) 모델에 근접한 성능을 유지하는 것을 목표로 합니다.
How it works
이 프로젝트는 Pairwise Rotation Quantization을 구현하여 학습된 쌍 회전을 사용해 가중치 이상치를 억제합니다. 이 기술을 통해 모델을 4비트(INT4)로 양자화하면서 양자화된 버전과 원본 FP16 모델 간의 정확도 차이를 줄이고, AWQ와 유사한 높은 추론 속도를 유지합니다.
Who it’s for
NVIDIA GPU(vLLM 및 Transformers를 통해)와 Apple Silicon(MLX를 통해) 등 다양한 하드웨어에서 효율적이고 고성능 LLM을 배포하고자 하는 개발자와 연구자를 위해 설계되었습니다.
Highlights
- High Accuracy: INT4 양자화에서도 FP16과 동등한 정확도를 달성합니다.
- Cross-Platform Support: NVIDIA GPU와 Apple Silicon을 모두 지원합니다.
- Broad Model Support: Gemma 4, Qwen, Llama 계열에 대한 사전 양자화 체크포인트를 제공합니다.
- Flexible Deployment: OpenAI 호환 API 서버와 인터랙티브 채팅 CLI를 포함합니다.
- Custom Quantization: 회전 파라미터를 최적화하고 커스텀 모델을 양자화하기 위한 도구를 제공합니다.