ModelCloud/GPTQModel

LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.

何を解決するか

GPT-QModel は LLM モデルの量子化(圧縮)用のツールキットであり、モデルの重みの精度を低下させることで、メモリ制限のあるハードウェア上で大規模モデルを実行可能にします。このツールキットは、幅広い種類のハードウェアアクセラレータや CPU において高性能モデルを活用できるようにする課題に対処します。

動作方法

このツールキットは、GPTQ、AWQ、ParoQuant、GGUF、FP8、EXL3 などを含む多様な量子化手法と、ハードウェア最適化されたカーネルを提供します。NVIDIA CUDA、AMD ROCm、Huawei Ascend NPU、Intel XPU、およびさまざまな CPU(Intel/AMD/Apple)を含む広範なハードウェアをサポートしています。Hugging Face Transformers、vLLM、SGLang などの人気フレームワークと統合され、量子化されたモデルを簡単に読み込み実行できるようにしています。

対象ユーザー

大規模言語モデルを多様なハードウェアにデプロイする必要がある AI 開発者や研究者、および MoE(エキスパートの混合)モデルやマルチモーダルモデルの推論速度と VRAM 使用量を最適化したい方々に最適です。

主な特徴

  • 広範なハードウェア対応: NVIDIA、AMD、Huawei Ascend、Intel XPU、Apple Silicon(MLX を通じて)のネイティブ加速をサポート。
  • 多様な量子化手法: GPTQ、AWQ、ParoQuant、GGUF、FP8、EXL3、QQQ をサポート。
  • MoE 最適化: マルチGPU環境におけるMoEモデル向けのデータ並列量子化と、量子化品質を向上させる専用ルーティング制御を実装。
  • マルチモーダル対応: 画像からテキストへのモデル向けに最適化された量子化。画像キャリブレーションデータを活用し、より良い結果を実現。
  • フレームワーク統合: Hugging Face、vLLM、SGLang、PEFT、Optimum とのシームレスな互換性を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch