intel/auto-round

A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.

What it solves

AutoRound 是一个量化工具包,允许大型语言模型(LLMs)和视觉语言模型(VLMs)压缩到超低位宽(2–4 位),同时保持高精度。它降低了这些模型的内存占用和计算需求,使其更容易在各种硬件上部署,而不会出现显著的性能损失。

How it works

该工具包使用 sign‑gradient descent 算法在量化过程中优化四舍五入过程。它提供多种“配方”(例如 auto-round-best 用于最高精度,或 auto-round-rtn 用于最快基线),在速度和精度之间取得平衡。还提供 AutoScheme API,能够自动生成混合精度量化配方,以优化模型大小与精度的权衡。

Who it’s for

它面向需要在内存受限硬件上部署 LLM 或 VLM 的 AI 开发者和研究者,以及将量化模型集成到生产环境中,使用 vLLM、SGLang 或 Transformers 等框架的用户。

Highlights

  • High Accuracy at Low Bits: 在 2–3 位下仍保持强劲性能。
  • Broad Ecosystem Integration: 可无缝配合 Transformers、vLLM、SGLang 与 LLM‑Compressor。
  • Multiple Export Formats: 支持 AutoRound、AutoAWQ、AutoGPTQ 与 GGUF 格式。
  • Efficient Tuning: 能在单个 GPU 上约 10 分钟量化 7B 模型。
  • VLM Support: 开箱即用量化超过 10 种视觉语言模型。
  • Hardware Compatibility: 支持 CPU(Xeon)、GPU(CUDA、Intel GPU)和 HPU(Gaudi)。