z-lab/paroquant
[ICLR 2026] ParoQuant: Pairwise Rotation Quantization for Efficient Reasoning LLM Inference
해결하는 문제
ParoQuant은 대규모 언어 모델(LLMs)에서 일반적으로 발생하는 INT4 양자화로 인한 정확도 저하를 해결합니다. 특히 추론 작업에 있어서 저정밀도(INT4)와 고정밀도(FP16) 모델 간의 성능 격차를 줄이고, 높은 추론 속도를 유지합니다.
작동 방식
이 프로젝트는 학습된 쌍별 회전을 사용하여 가중치 이상치를 억제하는 '쌍별 회전 양자화'를 구현합니다. 이 기법을 통해 기존 양자화 방법에서 흔히 발생하는 정확도 급락 없이 모델을 4비트 정밀도로 압축할 수 있습니다.
대상 사용자
제한된 하드웨어에서 대규모 모델을 효율적으로 실행해야 하는 개발자 및 연구자에게 적합합니다. 특히 NVIDIA GPU(vLLM 및 Transformers를 통해) 또는 Apple Silicon(MLX를 통해)을 사용하는 사용자를 대상으로 합니다.
주요 특징
- 고효율성: AWQ와 유사한 속도로 실행됩니다.
- 광범위한 하드웨어 호환성: NVIDIA GPU와 Apple Silicon 모두 지원합니다.
- 사전 양자화 모델: Hugging Face에서 Qwen, Gemma, Llama 모델의 ParoQuant 최적화 버전을 다수 제공합니다.
- 사용자 정의 양자화: 회전 파라미터 최적화 도구와 기존 모델을 ParoQuant 체크포인트로 변환하는 도구를 포함합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트