intel/auto-round

A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.

What it solves

AutoRound는 대형 언어 모델(LLMs)과 비전‑언어 모델(VLMs)을 초저비트 폭(2–4 비트)으로 압축하면서도 높은 정확도를 유지할 수 있게 해주는 양자화 툴킷입니다. 메모리 사용량과 연산 요구량을 줄여 다양한 하드웨어에 쉽게 배포할 수 있게 하며, 성능 손실이 거의 없습니다.

How it works

이 툴킷은 양자화 과정에서 라운딩을 최적화하기 위해 sign‑gradient descent 알고리즘을 사용합니다. auto-round-best(최고 정확도)나 auto-round-rtn(가장 빠른 베이스라인)과 같은 여러 "레시피"를 제공해 속도와 정밀도의 균형을 맞춥니다. 또한 AutoScheme API를 통해 모델 크기와 정확도 사이의 트레이드오프를 최적화하는 혼합 정밀도 양자화 레시피를 자동으로 생성합니다.

Who it’s for

메모리가 제한된 하드웨어에 LLM 또는 VLM을 배포해야 하는 AI 개발자·연구자와, vLLM, SGLang, Transformers와 같은 프레임워크를 사용해 양자화 모델을 프로덕션 환경에 통합하려는 사람들을 위해 설계되었습니다.

Highlights

  • High Accuracy at Low Bits: 2–3 비트에서도 강력한 성능 유지.
  • Broad Ecosystem Integration: Transformers, vLLM, SGLang, LLM‑Compressor와 원활히 연동.
  • Multiple Export Formats: AutoRound, AutoAWQ, AutoGPTQ, GGUF 포맷 지원.
  • Efficient Tuning: 단일 GPU에서 약 10분 만에 7B 모델을 양자화 가능.
  • VLM Support: 10개 이상의 비전‑언어 모델에 대한 즉시 양자화 제공.
  • Hardware Compatibility: CPU(Xeon), GPU(CUDA, Intel GPU), HPU(Gaudi)를 지원.