intel/neural-compressor

SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime

解決的問題

Intel Neural Compressor 透過減少模型大小與計算需求,解決大型深度學習模型部署的挑戰。它讓開發者能在不顯著犧牲效能的情況下壓縮模型,使其在各種硬體平台上的執行更加高效。

運作方式

該程式庫提供一整套模型壓縮技術,可應用於使用 PyTorch、TensorFlow 和 JAX 建構的模型。它實作了多種量化方法,包括:

  • 靜態與動態量化:降低權重與激活值的精度。
  • SmoothQuant:一種針對特定模型架構優化量化的技術。
  • 僅權重量化:僅壓縮模型權重以節省記憶體。
  • 量化感知訓練(QAT):將量化整合至訓練流程中。
  • 混合精度:為模型的不同部分使用不同的精度層級。
  • 高階 LLM/VLM 量化:透過與 AutoRound 集成,提供大語言模型(LLM)與視覺-語言模型(VLM)的專用支援。

適用對象

專為需要在 Intel 硬體(如 Gaudi AI 加速器、Xeon 處理器與資料中心 GPU)以及其他平台(如 AMD、ARM 和 NVIDIA GPU)上部署深度學習模型的 AI 工程師與研究人員設計。

主要特色

  • 多框架支援:支援 PyTorch、TensorFlow 與 JAX。
  • 廣泛的硬體相容性:針對 Intel Gaudi、Core Ultra、Xeon 與資料中心 GPU 優化,對其他 CPU 與 GPU 提供有限支援。
  • LLM/VLM 專項支援:提供專用工具用於壓縮 LLaMA、Qwen 與 DeepSeek 等模型。
  • 先進精度支援:支援實驗性低精度格式,包括 FP8、MXFP8、MXFP4 與 NVFP4。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案