Intel AutoRound: 대형 언어 모델(LLM) 및 비전-언어 모델(VLM)을 위한 고급 가중치 전용 양자화

Intel의 AutoRound는 가중치 전용 사후 훈련 양자화(PTQ) 도구로, 대형 언어 모델(LLM) 및 비전-언어 모델(VLM)의 크기와 추론 지연 시간을 줄이기 위해 설계되었습니다. 서명된 그래디언트 하강법을 사용하여 가중치 라운딩과 클리핑 범위를 공동 최적화함으로써, AutoRound는 최소한의 정확도 손실로 정확한 저비트 양자화(INT2~INT8)를 가능하게 합니다.

낮은 비트 폭에서의 우수한 정확도

AutoRound는 특히 2비트 정밀도에서 저비트 상황에서 상당한 성능 향상을 보여줍니다. 제공된 데이터에 따르면, AutoRound는 INT2에서 상대 정확도 기준으로 최대 2.1배까지 인기 있는 베이스라인을 능가할 수 있습니다. 또한 Low-Bit Open LLM Leaderboard에서 확인할 수 있듯이 4비트 정밀도에서도 경쟁력을 유지합니다.

기술적 역량 및 유연성

AutoRound는 효율성과 다양한 모델 아키텍처 및 하드웨어 백엔드와의 광범위한 호환성을 위해 설계되었습니다.

모델 및 디바이스 지원

  • LLMs: LLaMA, Qwen, DeepSeek 등 대부분의 인기 아키텍처를 지원합니다.
  • VLMs: Gemma3, Mistral-Small-3.1 등을 포함한 10개 이상의 비전-언어 모델을 지원합니다. 지원되지 않는 모델의 경우 --iters 0을 사용하여 RTN 방식을 적용할 수 있지만 일부 정확도 손실이 예상됩니다.
  • Hardware: CPUs, Intel GPUs, CUDA와 호환됩니다.

양자화 구성 및 포맷

AutoRound는 INT2, INT3, INT4, INT8 및 혼합 비트 튜닝을 포함한 다양한 가중치 전용 구성을 지원합니다. 도구는 상호 운용성을 보장하기 위해 여러 포맷으로 모델을 내보낼 수 있습니다.

  • AutoRound
  • GPTQ
  • AWQ
  • Select GGUF formats

양자화 효율성 및 성능

AutoRound는 200번의 튜닝 단계와 최대 128개의 샘플로 구성된 작은 캘리브레이션 데이터셋만으로 높은 정확도를 달성합니다. 이는 다른 INT2 방법에 비해 훨씬 빠르고 리소스 소모가 적습니다.

양자화 속도 벤치마크

"light mode"에서 AutoRound는 NVIDIA A100 GPU에서 72B 파라미터 모델을 37분 만에 양자화할 수 있습니다. 아래 표는 다양한 도구와 구성에서의 양자화 시간을 비교합니다.

모델 AutoAWQ (128 샘플) AutoAWQ (512 샘플) GPTQ (Transformers) AutoRound Light (128 샘플) AutoRound (128 샘플) AutoRound (512 샘플)
Qwen2.5 3B 7min 17min 13min 3min 8min 9min
Llama3.1-8B 13min 27min 22min 6min 13min 17min
Qwen2.5 72B 105min 230min OOM 37min 120min 149min

튜닝 레시피

AutoRound는 정확도와 속도 간의 균형을 맞추기 위해 세 가지 별도 레시피를 제공합니다.

  1. auto-round-best: 최대 정확도를 위해 최적화되었으며 2비트 양자화에 권장됩니다.
  2. auto-round (Default): 정확도와 튜닝 비용 사이의 균형 잡힌 선택을 제공합니다.
  3. auto-round-light: 최대 속도를 위해 최적화되었습니다.

구현 및 사용법

AutoRound는 pip(pip install auto-round)을 통해 설치할 수 있으며 명령줄 및 API 기반 워크플로우를 모두 지원합니다.

명령줄 인터페이스

사용자는 모델, 비트 폭, 그룹 크기 및 원하는 내보내기 포맷을 지정할 수 있습니다. 예시:

auto-round --model Qwen/Qwen3-0.6B --bits 4 --group_size 128 --format "auto_round,auto_awq,auto_gptq" --output_dir ./tmp_autoround

API 통합

AutoRound는 transformers 라이브러리와 통합되어 모델과 토크나이저를 로드하고 AutoRound 클래스를 초기화한 뒤 quantize_and_save를 사용해 양자화된 모델을 저장할 수 있습니다. 또한 기존 GPTQ 또는 AWQ 모델을 AutoRound 포맷으로 변환하여 Intel 디바이스와의 호환성을 향상시킬 수 있습니다.

Sources