intel/neural-compressor

SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime

解决的问题

Intel Neural Compressor 通过减小模型大小和计算需求,解决了部署大型深度学习模型的挑战。它允许开发者在不显著牺牲性能的情况下压缩模型,使其在各种硬件平台上运行更加高效。

工作原理

该库提供了一套模型压缩技术,可应用于使用 PyTorch、TensorFlow 和 JAX 构建的模型。它实现了多种量化方法,包括:

  • 静态和动态量化:降低权重和激活值的精度。
  • SmoothQuant:一种针对特定模型架构优化量化的技术。
  • 仅权重量化:仅压缩模型权重以节省内存。
  • 量化感知训练(QAT):将量化集成到训练过程中。
  • 混合精度:为模型的不同部分使用不同的精度级别。
  • 高级 LLM/VLM 量化:通过与 AutoRound 集成,为大语言模型(LLM)和视觉-语言模型(VLM)提供专用支持。

适用人群

专为需要在 Intel 硬件(如 Gaudi AI 加速器、Xeon 处理器和数据中心 GPU)以及其他平台(如 AMD、ARM 和 NVIDIA GPU)上部署深度学习模型的 AI 工程师和研究人员设计。

主要亮点

  • 多框架支持:支持 PyTorch、TensorFlow 和 JAX。
  • 广泛的硬件兼容性:针对 Intel Gaudi、Core Ultra、Xeon 和数据中心 GPU 进行优化,对其他 CPU 和 GPU 有限支持。
  • LLM/VLM 专项支持:提供专门工具用于压缩 LLaMA、Qwen 和 DeepSeek 等模型。
  • 前沿精度支持:支持实验性低精度格式,包括 FP8、MXFP8、MXFP4 和 NVFP4。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目