intel/auto-round

A SOTA quantization toolkit for high-accuracy low-bit LLM inference|简洁且高效的量化工具包

intel/auto‑round – LLM 与 VLM 的高级低比特量化工具包

是什么 – AutoRound 是一个 Python 库(Python 3.10+),可将大语言模型(LLM)和视觉-语言模型(VLM)量化至超低比特宽度(2–4 位),同时保留大部分原始精度。它采用“符号梯度下降”量化算法,并结合一系列可选的后处理步骤(AWQ、Hadamard 等)。

为何重要 – 量化可减小模型体积并降低推理延迟,使模型可在 CPU、Intel GPU(XPU)、NVIDIA GPU、Habana Gaudi HPU,甚至设备端环境中部署。AutoRound 声称在 2–3 位时达到业界领先精度,并与主流推理栈 TransformersvLLMSGLangLLM‑Compressor 实现无缝集成。


主要特性(README 中列出)

  • 2–4 位高精度 – 在数十个模型上进行基准测试,示例显示 INT2-混合模型性能超过原始性能的 97%。
  • 广泛硬件支持 – 支持 CPU(Xeon)、Intel XPU、CUDA GPU 和 Habana Gaudi HPU。
  • 多种导出格式 – 可输出为 AutoRound 原生格式、AutoAWQ、AutoGPTQ 和 GGUF(包括多种 GGUF 量化类型)。
  • 快速混合精度方案生成AutoScheme 工具可在几分钟内生成每层混合比特方案,仅需约 1.1–1.5 倍模型 BF16 内存作为开销。
  • 多种量化方案auto-roundauto-round-bestauto-round-lightauto-round-opt-rtnauto-round-rtn 等,允许用户在速度与精度之间权衡。
  • Torch-compile 加速 – 可选 torch.compile 加速(非 Windows 平台默认启用)。
  • 免校准 / 无模型模式 – 某些方案无需校准数据即可运行,且提供免费设备服务支持此类运行。
  • 支持 10+ 视觉-语言模型 – 提供开箱即用的多模态模型流水线。
  • 实验性扩展 – 算法组合(--algs awq,signround)、块级 FP8、MXFP/NVFP 数据类型、混合精度 AutoScheme 等。

安装

# CPU 或 CUDA GPU
pip install auto-round            # 稳定版
pip install auto-round-nightly    # 夜间构建版

# Habana Gaudi (HPU) – 在 Habana 容器内安装
pip install auto-round-hpu

# Intel XPU (GPU)
pip install torch --index-url https://download.pytorch.org/whl/xpu
pip install auto-round

*源码构建也支持,可通过 pip install .python setup.py install hpu 完成 Gaudi 安装。


快速开始(CLI)

auto-round \
  --model Qwen/Qwen3-0.6B \
  --scheme "W4A16" \
  --format "auto_round" \
  --output_dir ./quantized_qwen

--scheme 替换为任意支持的方案(如 W2A16MXFP4GGUF:Q4_K_M)。

快速开始(Python API)

from auto_round import AutoRound

ar = AutoRound(
    model_name_or_path="Qwen/Qwen3-0.6B",
    scheme="W4A16",
    iters=200,               # 调优迭代次数(0 = 纯 RTN)
    low_gpu_mem_usage=False # 设置为 True 可节省 VRAM,但会降低速度
)

ar.quantize_and_save(output_dir="./qmodel", format="auto_round")

API 与 CLI 选项一致;关键参数包括 schemebitsgroup_sizeiterslrdatasetdevice_map,以及用于算法扩展的实验性 enable_alg_ext 标志。


生态系统集成

  • Transformers – 转换后可通过 AutoModelForCausalLM.from_pretrained(..., device_map="auto") 直接加载量化模型。
  • vLLM – 通过 vLLM-Omni 分支实现原生支持(包括实验性 AutoScheme WOQ 部署)。
  • SGLang – 提供文档化的量化钩子。
  • LLM-Compressor – 作为插件,转发 AutoRound 的量化方案。
  • GGUF – 导出为 GGUF 格式,供 llama.cpp 及其他 GGUF 兼容运行时使用。

文档与资源

  • 用户指南 – 逐步教程:docs/step_by_step.md(英文与中文)。
  • 算法组合docs/algorithm_combinations.md
  • AutoScheme 精度docs/auto_scheme_acc.md
  • 基准排行榜 – Hugging Face 空间 Intel/low_bit_open_llm_leaderboard
  • 研究论文SignRoundV1(arXiv 2309.05516)和 SignRoundV2(arXiv 2512.04746)。

谁会使用它?

  • 希望将 LLM 缩小以用于边缘或成本受限推理的 ML 工程师
  • 试验超低比特量化算法的研究人员。
  • 需要即插即用量化器,且能与现有 Hugging Face 流水线和主流推理服务器兼容的产品团队。

TL;DR

AutoRound 是 Intel 的开源、pip 可安装工具包,可将 LLM/VLM 量化为 2–4 位表示,精度损失极小,支持广泛硬件,并可无缝集成到主流模型服务栈中。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目