ModelCloud/GPTQModel

LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.

解决的问题

GPT-QModel 是一个用于 LLM 模型量化(压缩)的工具包,通过降低模型权重的精度,使大型模型能够在内存受限的硬件上运行。它解决了在多种硬件加速器和 CPU 上实现高性能模型可用性的挑战。

工作原理

该工具包提供了一系列量化方法(包括 GPTQ、AWQ、ParoQuant、GGUF、FP8 和 EXL3)以及硬件优化的内核。它支持广泛的硬件,包括 NVIDIA CUDA、AMD ROCm、华为 Ascend NPU、Intel XPU 以及各种 CPU(Intel/AMD/Apple)。它与 Hugging Face Transformers、vLLM 和 SGLang 等流行框架集成,确保量化模型可以轻松加载和执行。

适用人群

专为需要将大型语言模型压缩以部署到多种硬件的 AI 开发者和研究人员设计,也适用于希望优化 MoE(专家混合)和多模态模型推理速度与显存使用效率的用户。

主要亮点

  • 广泛的硬件支持:原生支持 NVIDIA、AMD、华为 Ascend、Intel XPU 和 Apple Silicon(通过 MLX)。
  • 多样的量化方法:支持 GPTQ、AWQ、ParoQuant、GGUF、FP8、EXL3 和 QQQ。
  • MoE 优化:支持多 GPU 环境下 MoE 模型的数据并行量化,并提供专用路由控制以提升量化质量。
  • 多模态支持:针对图像到文本模型优化的量化,利用图像校准数据以获得更优结果。
  • 框架集成:与 Hugging Face、vLLM、SGLang、PEFT 和 Optimum 无缝兼容。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch