intel/auto-round
A SOTA quantization toolkit for high-accuracy low-bit LLM inference|简洁且高效的量化工具包
intel/auto‑round – LLM 및 VLM용 고급 저비트 양자화 툴킷
무엇인가요 – AutoRound은 대규모 언어 모델(LLM)과 시각-언어 모델(VLM)을 초저비트 폭(2–4비트)으로 양자화하는 Python 라이브러리(Python 3.10+)입니다. "부호-기울기 하강" 알고리즘과 다양한 선택적 후처리 단계(AWQ, Hadamard 등)를 사용해 원래 정확도의 대부분을 유지합니다.
왜 중요한가요 – 양자화는 모델 크기와 추론 지연을 줄여 CPU, Intel GPU(XPU), NVIDIA GPU, Habana Gaudi HPU, 심지어 온디바이스 환경에서도 배포 가능하게 합니다. AutoRound은 2–3비트에서 최첨단 정확도를 달성하며, Transformers, vLLM, SGLang, LLM-Compressor와 같은 인기 있는 추론 스택과 원활하게 통합됩니다.
주요 기능 (README에 기재된 내용)
- 2–4비트에서 높은 정확도 – 수십 개의 모델에서 벤치마크되었으며, INT2-믹스 모델의 경우 원래 성능의 97% 이상을 유지하는 예시가 있습니다.
- 광범위한 하드웨어 지원 – CPU(Xeon), Intel XPU, CUDA GPU, Habana Gaudi HPU에서 작동합니다.
- 다양한 내보내기 형식 – AutoRound의 네이티브 형식, AutoAWQ, AutoGPTQ, GGUF(다수의 GGUF 양자화 유형 포함)로 내보낼 수 있습니다.
- 빠른 혼합 정밀도 스킴 생성 – AutoScheme 유틸리티는 모델의 BF16 RAM의 약 1.1–1.5배의 오버헤드만으로 분층별 혼합 비트 레시피를 분 단위로 생성합니다.
- 다양한 양자화 레시피 –
auto-round,auto-round-best,auto-round-light,auto-round-opt-rtn,auto-round-rtn등으로 속도와 정확도 사이에서 선택 가능합니다. - Torch-compile 가속 – 선택적
torch.compile가속(비-Windows 플랫폼에서는 기본적으로 활성화됨). - 캘리브레이션 없음 / 모델 없음 모드 – 특정 스킴에서는 캘리브레이션 데이터 없이 실행 가능하며, 이러한 실행을 위한 무료 디바이스 서비스도 제공됩니다.
- 10개 이상의 시각-언어 모델 지원 – 멀티모달 모델용 즉시 사용 가능한 파이프라인.
- 실험적 확장 – 알고리즘 조합(
--algs awq,signround), 블록 단위 FP8, MXFP/NVFP 데이터형, 혼합 정밀도 AutoScheme 등.
설치
# CPU 또는 CUDA GPU
pip install auto-round # 안정 버전
pip install auto-round-nightly # 나이트리 빌드
# Habana Gaudi (HPU) – Habana 컨테이너 내부에 설치
pip install auto-round-hpu
# Intel XPU (GPU)
pip install torch --index-url https://download.pytorch.org/whl/xpu
pip install auto-round
*소스 빌드는 pip install . 또는 python setup.py install hpu로도 지원됩니다.
빠른 시작 (CLI)
auto-round \
--model Qwen/Qwen3-0.6B \
--scheme "W4A16" \
--format "auto_round" \
--output_dir ./quantized_qwen
--scheme를 W2A16, MXFP4, GGUF:Q4_K_M 등 지원되는 스킴으로 교체하세요.
빠른 시작 (Python API)
from auto_round import AutoRound
ar = AutoRound(
model_name_or_path="Qwen/Qwen3-0.6B",
scheme="W4A16",
iters=200, # 튜닝 반복 횟수 (0 = 순수 RTN)
low_gpu_mem_usage=False # VRAM 절약을 위해 True로 설정 (속도 저하 발생)
)
ar.quantize_and_save(output_dir="./qmodel", format="auto_round")
API는 CLI 옵션과 일치하며, 주요 인수로는 scheme, bits, group_size, iters, lr, dataset, device_map, 실험적 enable_alg_ext 플래그(알고리즘 확장용)가 있습니다.
생태계 통합
- Transformers – 변환 후
AutoModelForCausalLM.from_pretrained(..., device_map="auto")로 직접 로드 가능. - vLLM – vLLM-Omni 브랜치를 통해 네이티브 지원(실험적 AutoScheme WOQ 배포 포함).
- SGLang – 문서화된 양자화 훅.
- LLM-Compressor – AutoRound의 레시피를 전달하는 플러그인.
- GGUF – llama.cpp 및 기타 GGUF 호환 런타임에서 사용 가능한 GGUF 형식으로 내보내기.
문서 및 리소스
- 사용자 가이드 – 단계별 튜토리얼:
docs/step_by_step.md(영어 및 중국어). - 알고리즘 조합 –
docs/algorithm_combinations.md. - AutoScheme 정확도 –
docs/auto_scheme_acc.md. - 벤치마크 리더보드 – Hugging Face Space Intel/low_bit_open_llm_leaderboard.
- 연구 논문 – SignRoundV1 (arXiv 2309.05516) 및 SignRoundV2 (arXiv 2512.04746).
누구에게 적합한가요?
- 엣지 또는 비용 제약이 있는 추론을 위해 LLM을 축소하고 싶은 ML 엔지니어.
- 초저비트 양자화 알고리즘을 실험하고 싶은 연구자.
- 기존 Hugging Face 파이프라인과 주요 추론 서버와 호환되는 즉시 사용형 양자화 도구가 필요한 제품 팀.
TL;DR
AutoRound는 Intel의 오픈소스이며 pip로 설치 가능한 툴킷으로, LLM/VLM을 2–4비트 표현으로 양자화하면서 정확도 손실을 최소화하고, 광범위한 하드웨어를 지원하며 주요 모델 서빙 스택에 원활하게 통합됩니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트