intel/neural-compressor
SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime
解决的问题
Intel Neural Compressor 通过减小模型大小和计算需求,解决了部署大型深度学习模型的挑战。它允许开发者在不显著牺牲性能的情况下压缩模型,使其在各种硬件平台上运行更加高效。
工作原理
该库提供了一套模型压缩技术,可应用于使用 PyTorch、TensorFlow 和 JAX 构建的模型。它实现了多种量化方法,包括:
- 静态和动态量化:降低权重和激活值的精度。
- SmoothQuant:一种针对特定模型架构优化量化的技术。
- 仅权重量化:仅压缩模型权重以节省内存。
- 量化感知训练(QAT):将量化集成到训练过程中。
- 混合精度:为模型的不同部分使用不同的精度级别。
- 高级 LLM/VLM 量化:通过与 AutoRound 集成,为大语言模型(LLM)和视觉-语言模型(VLM)提供专用支持。
适用人群
专为需要在 Intel 硬件(如 Gaudi AI 加速器、Xeon 处理器和数据中心 GPU)以及其他平台(如 AMD、ARM 和 NVIDIA GPU)上部署深度学习模型的 AI 工程师和研究人员设计。
主要亮点
- 多框架支持:支持 PyTorch、TensorFlow 和 JAX。
- 广泛的硬件兼容性:针对 Intel Gaudi、Core Ultra、Xeon 和数据中心 GPU 进行优化,对其他 CPU 和 GPU 有限支持。
- LLM/VLM 专项支持:提供专门工具用于压缩 LLaMA、Qwen 和 DeepSeek 等模型。
- 前沿精度支持:支持实验性低精度格式,包括 FP8、MXFP8、MXFP4 和 NVFP4。
相关
- 项目
- 项目
- 项目
- 项目
- 项目