microsoft/VPTQ

VPTQ, A Flexible and Extreme low-bit quantization algorithm

解決する課題

VPTQは、高い精度を維持し、推論オーバーヘッドを最小限に抑えつつ、再学習を必要とせずに大規模言語モデル(LLM)を極めて低いビット幅(2ビット未満)に圧縮するという課題に対処します。

仕組み

ベクトル量子化に基づく新しいポストトレーニング量子化(PTQ)手法を利用しています。このアプローチにより、巨大なモデル(Llama-3.1 405Bなど)を1〜2ビットに圧縮することが可能です。プロセスは軽量に設計されており、405Bパラメータのモデルの量子化には約17時間を要します。

対象者

メモリ制限のあるハードウェア(例:単一のRTX 4090で70Bモデルを実行)に巨大なLLMをデプロイする必要があるAI開発者や研究者、および低デコードオーバーヘッドで高スループットの推論を求める人々。

ハイライト

  • 極限の圧縮: 最大405Bパラメータのモデルに対し、2ビット未満への圧縮をサポート。
  • 高い効率性: 軽量な量子化アルゴリズムと、最適化されたTime To First Token (TTFT) およびスループットによる機敏な推論。
  • 幅広い統合: Hugging Face Transformers ライブラリに統合済み。
  • 幅広いモデルサポート: Llama 3.1/3.3、DeepSeek R1、Mistral、Qwenを含む様々なモデルファミリーに対応。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト