microsoft/VPTQ
VPTQ, A Flexible and Extreme low-bit quantization algorithm
解決する課題
VPTQは、高い精度を維持し、推論オーバーヘッドを最小限に抑えつつ、再学習を必要とせずに大規模言語モデル(LLM)を極めて低いビット幅(2ビット未満)に圧縮するという課題に対処します。
仕組み
ベクトル量子化に基づく新しいポストトレーニング量子化(PTQ)手法を利用しています。このアプローチにより、巨大なモデル(Llama-3.1 405Bなど)を1〜2ビットに圧縮することが可能です。プロセスは軽量に設計されており、405Bパラメータのモデルの量子化には約17時間を要します。
対象者
メモリ制限のあるハードウェア(例:単一のRTX 4090で70Bモデルを実行)に巨大なLLMをデプロイする必要があるAI開発者や研究者、および低デコードオーバーヘッドで高スループットの推論を求める人々。
ハイライト
- 極限の圧縮: 最大405Bパラメータのモデルに対し、2ビット未満への圧縮をサポート。
- 高い効率性: 軽量な量子化アルゴリズムと、最適化されたTime To First Token (TTFT) およびスループットによる機敏な推論。
- 幅広い統合: Hugging Face Transformers ライブラリに統合済み。
- 幅広いモデルサポート: Llama 3.1/3.3、DeepSeek R1、Mistral、Qwenを含む様々なモデルファミリーに対応。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト