intel/auto-round
A SOTA quantization toolkit for high-accuracy low-bit LLM inference|简洁且高效的量化工具包
intel/auto‑round – LLM 与 VLM 的高级低比特量化工具包
是什么 – AutoRound 是一个 Python 库(Python 3.10+),可将大语言模型(LLM)和视觉-语言模型(VLM)量化至超低比特宽度(2–4 位),同时保留大部分原始精度。它采用“符号梯度下降”量化算法,并结合一系列可选的后处理步骤(AWQ、Hadamard 等)。
为何重要 – 量化可减小模型体积并降低推理延迟,使模型可在 CPU、Intel GPU(XPU)、NVIDIA GPU、Habana Gaudi HPU,甚至设备端环境中部署。AutoRound 声称在 2–3 位时达到业界领先精度,并与主流推理栈 Transformers、vLLM、SGLang 和 LLM‑Compressor 实现无缝集成。
主要特性(README 中列出)
- 2–4 位高精度 – 在数十个模型上进行基准测试,示例显示 INT2-混合模型性能超过原始性能的 97%。
- 广泛硬件支持 – 支持 CPU(Xeon)、Intel XPU、CUDA GPU 和 Habana Gaudi HPU。
- 多种导出格式 – 可输出为 AutoRound 原生格式、AutoAWQ、AutoGPTQ 和 GGUF(包括多种 GGUF 量化类型)。
- 快速混合精度方案生成 – AutoScheme 工具可在几分钟内生成每层混合比特方案,仅需约 1.1–1.5 倍模型 BF16 内存作为开销。
- 多种量化方案 –
auto-round、auto-round-best、auto-round-light、auto-round-opt-rtn、auto-round-rtn等,允许用户在速度与精度之间权衡。 - Torch-compile 加速 – 可选
torch.compile加速(非 Windows 平台默认启用)。 - 免校准 / 无模型模式 – 某些方案无需校准数据即可运行,且提供免费设备服务支持此类运行。
- 支持 10+ 视觉-语言模型 – 提供开箱即用的多模态模型流水线。
- 实验性扩展 – 算法组合(
--algs awq,signround)、块级 FP8、MXFP/NVFP 数据类型、混合精度 AutoScheme 等。
安装
# CPU 或 CUDA GPU
pip install auto-round # 稳定版
pip install auto-round-nightly # 夜间构建版
# Habana Gaudi (HPU) – 在 Habana 容器内安装
pip install auto-round-hpu
# Intel XPU (GPU)
pip install torch --index-url https://download.pytorch.org/whl/xpu
pip install auto-round
*源码构建也支持,可通过 pip install . 或 python setup.py install hpu 完成 Gaudi 安装。
快速开始(CLI)
auto-round \
--model Qwen/Qwen3-0.6B \
--scheme "W4A16" \
--format "auto_round" \
--output_dir ./quantized_qwen
将 --scheme 替换为任意支持的方案(如 W2A16、MXFP4、GGUF:Q4_K_M)。
快速开始(Python API)
from auto_round import AutoRound
ar = AutoRound(
model_name_or_path="Qwen/Qwen3-0.6B",
scheme="W4A16",
iters=200, # 调优迭代次数(0 = 纯 RTN)
low_gpu_mem_usage=False # 设置为 True 可节省 VRAM,但会降低速度
)
ar.quantize_and_save(output_dir="./qmodel", format="auto_round")
API 与 CLI 选项一致;关键参数包括 scheme、bits、group_size、iters、lr、dataset、device_map,以及用于算法扩展的实验性 enable_alg_ext 标志。
生态系统集成
- Transformers – 转换后可通过
AutoModelForCausalLM.from_pretrained(..., device_map="auto")直接加载量化模型。 - vLLM – 通过 vLLM-Omni 分支实现原生支持(包括实验性 AutoScheme WOQ 部署)。
- SGLang – 提供文档化的量化钩子。
- LLM-Compressor – 作为插件,转发 AutoRound 的量化方案。
- GGUF – 导出为 GGUF 格式,供 llama.cpp 及其他 GGUF 兼容运行时使用。
文档与资源
- 用户指南 – 逐步教程:
docs/step_by_step.md(英文与中文)。 - 算法组合 –
docs/algorithm_combinations.md。 - AutoScheme 精度 –
docs/auto_scheme_acc.md。 - 基准排行榜 – Hugging Face 空间 Intel/low_bit_open_llm_leaderboard。
- 研究论文 – SignRoundV1(arXiv 2309.05516)和 SignRoundV2(arXiv 2512.04746)。
谁会使用它?
- 希望将 LLM 缩小以用于边缘或成本受限推理的 ML 工程师。
- 试验超低比特量化算法的研究人员。
- 需要即插即用量化器,且能与现有 Hugging Face 流水线和主流推理服务器兼容的产品团队。
TL;DR
AutoRound 是 Intel 的开源、pip 可安装工具包,可将 LLM/VLM 量化为 2–4 位表示,精度损失极小,支持广泛硬件,并可无缝集成到主流模型服务栈中。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目