Intel AutoRound:先進的僅權重量化,適用於 LLM 與 VLM

Intel 的 AutoRound 是一款僅權重的後訓練量化(PTQ)工具,旨在減少大型語言模型(LLMs)與視覺語言模型(VLMs)的大小與推論延遲。透過使用有號梯度下降共同優化權重量化與裁剪範圍,AutoRound 能以最小的精度損失實現高準確度的低位元量化(INT2 至 INT8)。

低位元寬度下的卓越精度

AutoRound 在低位元情境下展現顯著的效能提升,尤其在 2 位元精度時。根據提供的數據,AutoRound 在 INT2 上的相對精度可比流行基線高出最高 2.1 倍。它在 4 位元精度上亦保持競爭優勢,這可從其在 Low-Bit Open LLM Leaderboard 上的表現看出。

技術能力與彈性

AutoRound 旨在提升效率並在不同模型架構與硬體後端之間具備廣泛相容性。

模型與裝置支援

  • LLMs: 支援大多數流行的架構,包括 LLaMA、Qwen 與 DeepSeek。
  • VLMs: 支援超過 10 種視覺語言模型,包括 Gemma3 與 Mistral‑Small‑3.1。對於不支援的模型,可使用 --iters 0 套用 RTN 方法,雖然預期會有一定的精度損失。
  • Hardware: 相容於 CPU、Intel GPU 與 CUDA。

量化配置與格式

AutoRound 支援多種僅權重的配置,包括 INT2、INT3、INT4、INT8 與混合位元調校。此工具可將模型匯出為多種格式以確保互通性,包括:

  • AutoRound
  • GPTQ
  • AWQ
  • 選擇性的 GGUF 格式

量化效率與效能

AutoRound 僅使用 200 步的調校以及最多 128 樣本的小型校準資料集,即可達到高精度。這使其相較於其他 INT2 方法更快且資源需求更低。

量化速度基準

在「輕量模式」下,AutoRound 能在 NVIDIA A100 GPU 上於 37 分鐘內量化一個 72B 參數的模型。下表比較了不同工具與配置的量化時間:

模型 AutoAWQ(128 樣本) AutoAWQ(512 樣本) GPTQ(Transformers) AutoRound Light(128 樣本) AutoRound(128 樣本) AutoRound(512 樣本)
Qwen2.5 3B 7min 17min 13min 3min 8min 9min
Llama3.1-8B 13min 27min 22min 6min 13min 17min
Qwen2.5 72B 105min 230min OOM 37min 120min 149min

調校配方

AutoRound 提供三種不同的配方,以在精度與速度之間取得平衡:

  1. auto-round-best:針對最高精度進行最佳化,建議用於 2 位元量化。
  2. auto-round(預設):在精度與調校成本之間提供平衡的取捨。
  3. auto-round-light:針對最高速度進行最佳化。

實作與使用

AutoRound 可透過 pip 安裝(pip install auto-round),並支援命令列與 API 為基礎的工作流程。

命令列介面

使用者可以指定模型、位元寬度、群組大小與欲匯出的格式。例如:

auto-round --model Qwen/Qwen3-0.6B --bits 4 --group_size 128 --format "auto_round,auto_awq,auto_gptq" --output_dir ./tmp_autoround

API 整合

AutoRound 可與 transformers 函式庫整合,讓使用者載入模型與分詞器、初始化 AutoRound 類別,並使用 quantize_and_save 儲存量化後的模型。它亦支援將現有的 GPTQ 或 AWQ 模型轉換為 AutoRound 格式,以提升與 Intel 裝置的相容性。

Sources