intel/auto-round
A SOTA quantization toolkit for high-accuracy low-bit LLM inference|简洁且高效的量化工具包
intel/auto‑round – LLM 與 VLM 用的高階低比特量化工具包
是什麼 – AutoRound 是一個 Python 庫(Python 3.10+),可將大型語言模型(LLM)與視覺-語言模型(VLM)量化至超低比特寬度(2–4 位),同時保留大部分原始準確度。它採用「符號梯度下降」量化演算法,並結合一系列可選的後處理步驟(AWQ、Hadamard 等)。
為何重要 – 量化可減少模型體積與推論延遲,使模型能在 CPU、Intel GPU(XPU)、NVIDIA GPU、Habana Gaudi HPU,甚至設備端環境中部署。AutoRound 宣稱在 2–3 位時達到業界領先準確度,並與主流推論堆疊 Transformers、vLLM、SGLang 和 LLM‑Compressor 實現無縫整合。
主要功能(README 中列出)
- 2–4 位高準確度 – 在數十個模型上進行基準測試,範例顯示 INT2-混合模型性能超過原始性能的 97%。
- 廣泛硬體支援 – 支援 CPU(Xeon)、Intel XPU、CUDA GPU 和 Habana Gaudi HPU。
- 多種匯出格式 – 可輸出為 AutoRound 原生格式、AutoAWQ、AutoGPTQ 和 GGUF(包含多種 GGUF 量化類型)。
- 快速混合精度方案生成 – AutoScheme 工具可在數分鐘內生成每層混合比特方案,僅需約 1.1–1.5 倍模型 BF16 記憶體作為開銷。
- 多種量化方案 –
auto-round、auto-round-best、auto-round-light、auto-round-opt-rtn、auto-round-rtn等,允許使用者在速度與準確度之間權衡。 - Torch-compile 加速 – 可選
torch.compile加速(非 Windows 平台預設啟用)。 - 免校準 / 無模型模式 – 某些方案無需校準資料即可執行,並提供免費設備服務支援此類執行。
- 支援 10+ 視覺-語言模型 – 提供開箱即用的多模態模型流程。
- 實驗性擴充 – 算法組合(
--algs awq,signround)、區塊級 FP8、MXFP/NVFP 資料型態、混合精度 AutoScheme 等。
安裝
# CPU 或 CUDA GPU
pip install auto-round # 穩定版
pip install auto-round-nightly # 夜間建構版
# Habana Gaudi (HPU) – 在 Habana 容器內安裝
pip install auto-round-hpu
# Intel XPU (GPU)
pip install torch --index-url https://download.pytorch.org/whl/xpu
pip install auto-round
*原始碼建構也支援,可透過 pip install . 或 python setup.py install hpu 完成 Gaudi 安裝。
快速開始(CLI)
auto-round \
--model Qwen/Qwen3-0.6B \
--scheme "W4A16" \
--format "auto_round" \
--output_dir ./quantized_qwen
將 --scheme 替換為任意支援的方案(如 W2A16、MXFP4、GGUF:Q4_K_M)。
快速開始(Python API)
from auto_round import AutoRound
ar = AutoRound(
model_name_or_path="Qwen/Qwen3-0.6B",
scheme="W4A16",
iters=200, # 調優迭代次數(0 = 純 RTN)
low_gpu_mem_usage=False # 設為 True 可節省 VRAM,但會降低速度
)
ar.quantize_and_save(output_dir="./qmodel", format="auto_round")
API 與 CLI 選項一致;關鍵參數包括 scheme、bits、group_size、iters、lr、dataset、device_map,以及用於演算法擴充的實驗性 enable_alg_ext 標誌。
生態系統整合
- Transformers – 轉換後可透過
AutoModelForCausalLM.from_pretrained(..., device_map="auto")直接載入量化模型。 - vLLM – 透過 vLLM-Omni 分支實現原生支援(包含實驗性 AutoScheme WOQ 部署)。
- SGLang – 提供文件化的量化鈎子。
- LLM-Compressor – 作為插件,轉發 AutoRound 的量化方案。
- GGUF – 導出為 GGUF 格式,供 llama.cpp 及其他 GGUF 相容執行時使用。
文件與資源
- 使用者指南 – 逐步教學:
docs/step_by_step.md(英文與中文)。 - 演算法組合 –
docs/algorithm_combinations.md。 - AutoScheme 準確度 –
docs/auto_scheme_acc.md。 - 基準排行榜 – Hugging Face 空間 Intel/low_bit_open_llm_leaderboard。
- 研究論文 – SignRoundV1(arXiv 2309.05516)與 SignRoundV2(arXiv 2512.04746)。
誰會使用它?
- 希望將 LLM 壓縮以用於邊緣或成本受限推論的 ML 工程師。
- 試驗超低比特量化演算法的研究人員。
- 需要即插即用量化器,且能與現有 Hugging Face 流程與主流推論伺服器相容的產品團隊。
TL;DR
AutoRound 是 Intel 的開源、pip 可安裝工具包,可將 LLM/VLM 量化為 2–4 位表示,精度損失極小,支援廣泛硬體,並可無縫整合到主流模型服務堆疊中。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案