intel/auto-round

A SOTA quantization toolkit for high-accuracy low-bit LLM inference|简洁且高效的量化工具包

intel/auto‑round – LLM 與 VLM 用的高階低比特量化工具包

是什麼 – AutoRound 是一個 Python 庫(Python 3.10+),可將大型語言模型(LLM)與視覺-語言模型(VLM)量化至超低比特寬度(2–4 位),同時保留大部分原始準確度。它採用「符號梯度下降」量化演算法,並結合一系列可選的後處理步驟(AWQ、Hadamard 等)。

為何重要 – 量化可減少模型體積與推論延遲,使模型能在 CPU、Intel GPU(XPU)、NVIDIA GPU、Habana Gaudi HPU,甚至設備端環境中部署。AutoRound 宣稱在 2–3 位時達到業界領先準確度,並與主流推論堆疊 TransformersvLLMSGLangLLM‑Compressor 實現無縫整合。


主要功能(README 中列出)

  • 2–4 位高準確度 – 在數十個模型上進行基準測試,範例顯示 INT2-混合模型性能超過原始性能的 97%。
  • 廣泛硬體支援 – 支援 CPU(Xeon)、Intel XPU、CUDA GPU 和 Habana Gaudi HPU。
  • 多種匯出格式 – 可輸出為 AutoRound 原生格式、AutoAWQ、AutoGPTQ 和 GGUF(包含多種 GGUF 量化類型)。
  • 快速混合精度方案生成AutoScheme 工具可在數分鐘內生成每層混合比特方案,僅需約 1.1–1.5 倍模型 BF16 記憶體作為開銷。
  • 多種量化方案auto-roundauto-round-bestauto-round-lightauto-round-opt-rtnauto-round-rtn 等,允許使用者在速度與準確度之間權衡。
  • Torch-compile 加速 – 可選 torch.compile 加速(非 Windows 平台預設啟用)。
  • 免校準 / 無模型模式 – 某些方案無需校準資料即可執行,並提供免費設備服務支援此類執行。
  • 支援 10+ 視覺-語言模型 – 提供開箱即用的多模態模型流程。
  • 實驗性擴充 – 算法組合(--algs awq,signround)、區塊級 FP8、MXFP/NVFP 資料型態、混合精度 AutoScheme 等。

安裝

# CPU 或 CUDA GPU
pip install auto-round            # 穩定版
pip install auto-round-nightly    # 夜間建構版

# Habana Gaudi (HPU) – 在 Habana 容器內安裝
pip install auto-round-hpu

# Intel XPU (GPU)
pip install torch --index-url https://download.pytorch.org/whl/xpu
pip install auto-round

*原始碼建構也支援,可透過 pip install .python setup.py install hpu 完成 Gaudi 安裝。


快速開始(CLI)

auto-round \
  --model Qwen/Qwen3-0.6B \
  --scheme "W4A16" \
  --format "auto_round" \
  --output_dir ./quantized_qwen

--scheme 替換為任意支援的方案(如 W2A16MXFP4GGUF:Q4_K_M)。

快速開始(Python API)

from auto_round import AutoRound

ar = AutoRound(
    model_name_or_path="Qwen/Qwen3-0.6B",
    scheme="W4A16",
    iters=200,               # 調優迭代次數(0 = 純 RTN)
    low_gpu_mem_usage=False # 設為 True 可節省 VRAM,但會降低速度
)

ar.quantize_and_save(output_dir="./qmodel", format="auto_round")

API 與 CLI 選項一致;關鍵參數包括 schemebitsgroup_sizeiterslrdatasetdevice_map,以及用於演算法擴充的實驗性 enable_alg_ext 標誌。


生態系統整合

  • Transformers – 轉換後可透過 AutoModelForCausalLM.from_pretrained(..., device_map="auto") 直接載入量化模型。
  • vLLM – 透過 vLLM-Omni 分支實現原生支援(包含實驗性 AutoScheme WOQ 部署)。
  • SGLang – 提供文件化的量化鈎子。
  • LLM-Compressor – 作為插件,轉發 AutoRound 的量化方案。
  • GGUF – 導出為 GGUF 格式,供 llama.cpp 及其他 GGUF 相容執行時使用。

文件與資源

  • 使用者指南 – 逐步教學:docs/step_by_step.md(英文與中文)。
  • 演算法組合docs/algorithm_combinations.md
  • AutoScheme 準確度docs/auto_scheme_acc.md
  • 基準排行榜 – Hugging Face 空間 Intel/low_bit_open_llm_leaderboard
  • 研究論文SignRoundV1(arXiv 2309.05516)與 SignRoundV2(arXiv 2512.04746)。

誰會使用它?

  • 希望將 LLM 壓縮以用於邊緣或成本受限推論的 ML 工程師
  • 試驗超低比特量化演算法的研究人員。
  • 需要即插即用量化器,且能與現有 Hugging Face 流程與主流推論伺服器相容的產品團隊。

TL;DR

AutoRound 是 Intel 的開源、pip 可安裝工具包,可將 LLM/VLM 量化為 2–4 位表示,精度損失極小,支援廣泛硬體,並可無縫整合到主流模型服務堆疊中。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案