ModelCloud/GPTQModel
LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.
解決的問題
GPT-QModel 是一個用於 LLM 模型量化(壓縮)的工具包,透過降低模型權重的精度,讓大型模型能在記憶體受限的硬體上執行。它解決了在多種硬體加速器與 CPU 上讓高效率模型可存取的挑戰。
如何運作
該工具包提供一系列量化方法(包含 GPTQ、AWQ、ParoQuant、GGUF、FP8 和 EXL3)以及硬體最佳化的內核。支援廣泛的硬體,包括 NVIDIA CUDA、AMD ROCm、華為 Ascend NPU、Intel XPU 以及各種 CPU(Intel/AMD/Apple)。與 Hugging Face Transformers、vLLM 和 SGLang 等流行框架整合,確保量化模型能輕鬆載入與執行。
適用對象
專為需要將大型語言模型壓縮以部署至多樣硬體的 AI 開發者與研究人員設計,也適用於希望優化 MoE(專家混合)與多模態模型推理速度與 VRAM 使用效率的使用者。
主要特色
- 廣泛的硬體支援:原生支援 NVIDIA、AMD、華為 Ascend、Intel XPU 與 Apple Silicon(透過 MLX)。
- 多樣的量化方法:支援 GPTQ、AWQ、ParoQuant、GGUF、FP8、EXL3 與 QQQ。
- MoE 優化:支援多 GPU 環境下 MoE 模型的資料平行量化,並提供專用路由控制以提升量化品質。
- 多模態支援:針對圖像轉文字模型優化的量化,利用圖像校準資料以獲得更佳結果。
- 框架整合:與 Hugging Face、vLLM、SGLang、PEFT 與 Optimum 無縫相容。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch