Intel AutoRound:先進的僅權重量化,適用於 LLM 與 VLM
Intel 的 AutoRound 是一款僅權重的後訓練量化(PTQ)工具,旨在減少大型語言模型(LLMs)與視覺語言模型(VLMs)的大小與推論延遲。透過使用有號梯度下降共同優化權重量化與裁剪範圍,AutoRound 能以最小的精度損失實現高準確度的低位元量化(INT2 至 INT8)。
低位元寬度下的卓越精度
AutoRound 在低位元情境下展現顯著的效能提升,尤其在 2 位元精度時。根據提供的數據,AutoRound 在 INT2 上的相對精度可比流行基線高出最高 2.1 倍。它在 4 位元精度上亦保持競爭優勢,這可從其在 Low-Bit Open LLM Leaderboard 上的表現看出。
技術能力與彈性
AutoRound 旨在提升效率並在不同模型架構與硬體後端之間具備廣泛相容性。
模型與裝置支援
- LLMs: 支援大多數流行的架構,包括 LLaMA、Qwen 與 DeepSeek。
- VLMs: 支援超過 10 種視覺語言模型,包括 Gemma3 與 Mistral‑Small‑3.1。對於不支援的模型,可使用
--iters 0套用 RTN 方法,雖然預期會有一定的精度損失。 - Hardware: 相容於 CPU、Intel GPU 與 CUDA。
量化配置與格式
AutoRound 支援多種僅權重的配置,包括 INT2、INT3、INT4、INT8 與混合位元調校。此工具可將模型匯出為多種格式以確保互通性,包括:
- AutoRound
- GPTQ
- AWQ
- 選擇性的 GGUF 格式
量化效率與效能
AutoRound 僅使用 200 步的調校以及最多 128 樣本的小型校準資料集,即可達到高精度。這使其相較於其他 INT2 方法更快且資源需求更低。
量化速度基準
在「輕量模式」下,AutoRound 能在 NVIDIA A100 GPU 上於 37 分鐘內量化一個 72B 參數的模型。下表比較了不同工具與配置的量化時間:
| 模型 | AutoAWQ(128 樣本) | AutoAWQ(512 樣本) | GPTQ(Transformers) | AutoRound Light(128 樣本) | AutoRound(128 樣本) | AutoRound(512 樣本) |
|---|---|---|---|---|---|---|
| Qwen2.5 3B | 7min | 17min | 13min | 3min | 8min | 9min |
| Llama3.1-8B | 13min | 27min | 22min | 6min | 13min | 17min |
| Qwen2.5 72B | 105min | 230min | OOM | 37min | 120min | 149min |
調校配方
AutoRound 提供三種不同的配方,以在精度與速度之間取得平衡:
auto-round-best:針對最高精度進行最佳化,建議用於 2 位元量化。auto-round(預設):在精度與調校成本之間提供平衡的取捨。auto-round-light:針對最高速度進行最佳化。
實作與使用
AutoRound 可透過 pip 安裝(pip install auto-round),並支援命令列與 API 為基礎的工作流程。
命令列介面
使用者可以指定模型、位元寬度、群組大小與欲匯出的格式。例如:
auto-round --model Qwen/Qwen3-0.6B --bits 4 --group_size 128 --format "auto_round,auto_awq,auto_gptq" --output_dir ./tmp_autoround
API 整合
AutoRound 可與 transformers 函式庫整合,讓使用者載入模型與分詞器、初始化 AutoRound 類別,並使用 quantize_and_save 儲存量化後的模型。它亦支援將現有的 GPTQ 或 AWQ 模型轉換為 AutoRound 格式,以提升與 Intel 裝置的相容性。