intel/neural-compressor
SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime
해결하는 문제
Intel Neural Compressor는 대규모 딥러닝 모델을 배포하는 과정에서 발생하는 문제를 해결하기 위해 모델 크기와 계산 요구 사항을 줄입니다. 성능을 크게 훼손하지 않고 모델을 압축할 수 있어 다양한 하드웨어 플랫폼에서 더 효율적으로 실행할 수 있습니다.
작동 방식
이 라이브러리는 PyTorch, TensorFlow, JAX로 구축된 모델에 적용 가능한 모델 압축 기술 세트를 제공합니다. 다음과 같은 여러 가지 양자화 방법을 구현하고 있습니다:
- 정적 및 동적 양자화: 가중치와 활성화의 정밀도를 낮춥니다.
- SmoothQuant: 특정 모델 아키텍처에 최적화된 양자화를 위한 기술입니다.
- 무게만 양자화: 모델의 가중치만 압축하여 메모리 사용량을 줄입니다.
- 양자화 인식 학습 (QAT): 양자화를 학습 과정에 통합합니다.
- 혼합 정밀도: 모델의 서로 다른 부분에 서로 다른 정밀도 수준을 사용합니다.
- 고급 LLM/VLM 양자화: AutoRound와의 통합을 통해 대규모 언어 모델(Large Language Models)과 시각-언어 모델(Vision-Language Models)에 특화된 지원을 제공합니다.
대상 사용자
Intel 하드웨어(예: Gaudi AI 가속기, Xeon 프로세서, 데이터센터 GPU 등)를 포함한 다양한 플랫폼(AMD, ARM, NVIDIA GPU 등)에서 딥러닝 모델을 배포하기 위해 최적화가 필요한 AI 엔지니어 및 연구자들을 위한 것입니다.
주요 특징
- 다중 프레임워크 지원: PyTorch, TensorFlow, JAX 모두에서 작동합니다.
- 광범위한 하드웨어 호환성: Intel Gaudi, Core Ultra, Xeon, 데이터센터 GPU에 최적화되었으며, 기타 CPU 및 GPU에도 제한적 지원이 제공됩니다.
- LLM/VLM 전용 기능: LLaMA, Qwen, DeepSeek 등의 모델을 압축하기 위한 전용 도구 제공.
- 최신 정밀도 지원: FP8, MXFP8, MXFP4, NVFP4와 같은 실험적 저정밀도 형식을 지원합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트