ModelCloud/GPTQModel

LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.

解決的問題

GPT-QModel 是一個用於 LLM 模型量化(壓縮)的工具包,透過降低模型權重的精度,讓大型模型能在記憶體受限的硬體上執行。它解決了在多種硬體加速器與 CPU 上讓高效率模型可存取的挑戰。

如何運作

該工具包提供一系列量化方法(包含 GPTQ、AWQ、ParoQuant、GGUF、FP8 和 EXL3)以及硬體最佳化的內核。支援廣泛的硬體,包括 NVIDIA CUDA、AMD ROCm、華為 Ascend NPU、Intel XPU 以及各種 CPU(Intel/AMD/Apple)。與 Hugging Face Transformers、vLLM 和 SGLang 等流行框架整合,確保量化模型能輕鬆載入與執行。

適用對象

專為需要將大型語言模型壓縮以部署至多樣硬體的 AI 開發者與研究人員設計,也適用於希望優化 MoE(專家混合)與多模態模型推理速度與 VRAM 使用效率的使用者。

主要特色

  • 廣泛的硬體支援:原生支援 NVIDIA、AMD、華為 Ascend、Intel XPU 與 Apple Silicon(透過 MLX)。
  • 多樣的量化方法:支援 GPTQ、AWQ、ParoQuant、GGUF、FP8、EXL3 與 QQQ。
  • MoE 優化:支援多 GPU 環境下 MoE 模型的資料平行量化,並提供專用路由控制以提升量化品質。
  • 多模態支援:針對圖像轉文字模型優化的量化,利用圖像校準資料以獲得更佳結果。
  • 框架整合:與 Hugging Face、vLLM、SGLang、PEFT 與 Optimum 無縫相容。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch