intel/neural-compressor
SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime
解決的問題
Intel Neural Compressor 透過減少模型大小與計算需求,解決大型深度學習模型部署的挑戰。它讓開發者能在不顯著犧牲效能的情況下壓縮模型,使其在各種硬體平台上的執行更加高效。
運作方式
該程式庫提供一整套模型壓縮技術,可應用於使用 PyTorch、TensorFlow 和 JAX 建構的模型。它實作了多種量化方法,包括:
- 靜態與動態量化:降低權重與激活值的精度。
- SmoothQuant:一種針對特定模型架構優化量化的技術。
- 僅權重量化:僅壓縮模型權重以節省記憶體。
- 量化感知訓練(QAT):將量化整合至訓練流程中。
- 混合精度:為模型的不同部分使用不同的精度層級。
- 高階 LLM/VLM 量化:透過與 AutoRound 集成,提供大語言模型(LLM)與視覺-語言模型(VLM)的專用支援。
適用對象
專為需要在 Intel 硬體(如 Gaudi AI 加速器、Xeon 處理器與資料中心 GPU)以及其他平台(如 AMD、ARM 和 NVIDIA GPU)上部署深度學習模型的 AI 工程師與研究人員設計。
主要特色
- 多框架支援:支援 PyTorch、TensorFlow 與 JAX。
- 廣泛的硬體相容性:針對 Intel Gaudi、Core Ultra、Xeon 與資料中心 GPU 優化,對其他 CPU 與 GPU 提供有限支援。
- LLM/VLM 專項支援:提供專用工具用於壓縮 LLaMA、Qwen 與 DeepSeek 等模型。
- 先進精度支援:支援實驗性低精度格式,包括 FP8、MXFP8、MXFP4 與 NVFP4。
相關
- 專案
- 專案
- 專案
- 專案
- 專案