ModelCloud/GPTQModel
LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.
해결하는 문제
GPT-QModel은 LLM 모델의 양자화(압축)를 위한 툴킷으로, 모델 가중치의 정밀도를 낮춤으로써 메모리 제한이 있는 하드웨어에서도 대규모 모델을 실행할 수 있도록 합니다. 이는 다양한 하드웨어 가속기와 CPU에서 고성능 모델을 활용할 수 있도록 하는 도전 과제를 해결합니다.
작동 방식
이 툴킷은 GPTQ, AWQ, ParoQuant, GGUF, FP8, EXL3 등을 포함한 다양한 양자화 방법과 하드웨어 최적화된 커널을 제공합니다. NVIDIA CUDA, AMD ROCm, Huawei Ascend NPU, Intel XPU, 다양한 CPU(Intel/AMD/Apple)를 포함한 광범위한 하드웨어를 지원합니다. Hugging Face Transformers, vLLM, SGLang 등의 인기 프레임워크와 통합되어, 양자화된 모델을 쉽게 로드하고 실행할 수 있도록 합니다.
대상 사용자
다양한 하드웨어에 대규모 언어 모델을 배포하기 위해 모델을 압축해야 하는 AI 개발자 및 연구자, 그리고 MoE(Mixture of Experts) 및 멀티모달 모델의 추론 속도와 VRAM 사용량을 최적화하고자 하는 사용자에게 적합합니다.
주요 특징
- 광범위한 하드웨어 지원: NVIDIA, AMD, Huawei Ascend, Intel XPU, Apple Silicon(MLX를 통해)에 대한 네이티브 가속 지원.
- 다양한 양자화 방법: GPTQ, AWQ, ParoQuant, GGUF, FP8, EXL3, QQQ를 지원.
- MoE 최적화: 멀티 GPU 환경에서 MoE 모델을 위한 데이터 병렬 양자화 및 양자화 품질을 향상시키는 전용 라우팅 제어 기능 제공.
- 멀티모달 지원: 이미지에서 텍스트로의 모델을 위한 최적화된 양자화. 이미지 캘리브레이션 데이터를 활용해 더 나은 성능을 제공.
- 프레임워크 통합: Hugging Face, vLLM, SGLang, PEFT, Optimum과의 원활한 호환성 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch