intel/neural-compressor

SOTA low-bit LLM quantization (INT8/FP8/MXFP8/INT4/MXFP4/NVFP4) & sparsity; leading model compression techniques on PyTorch, TensorFlow, and ONNX Runtime

何を解決するか

Intel Neural Compressor は、大規模なディープラーニングモデルをデプロイする際の課題に対処し、モデルのサイズと計算リソースを削減します。開発者が顕著なパフォーマンスの低下を伴わずにモデルを圧縮できるため、さまざまなハードウェアプラットフォーム上でより効率的に実行できるようになります。

動作方法

このライブラリは、PyTorch、TensorFlow、JAX で構築されたモデルに適用可能なモデル圧縮技術のセットを提供します。以下の複数の量子化手法を実装しています:

  • 静的および動的量子化:重みと活性化の精度を低下させる。
  • SmoothQuant:特定のモデルアーキテクチャ向けに量子化を最適化する技術。
  • 重みのみ量子化:モデルの重みのみを圧縮してメモリを節約する。
  • 量子化対応学習(QAT):量子化を学習プロセスに統合する。
  • ミックスドプレシジョン:モデルの異なる部分に異なる精度レベルを使用する。
  • 高度な LLM/VLM 量子化:AutoRound との統合により、大規模言語モデル(LLM)および視覚言語モデル(VLM)向けの専用サポート。

対象ユーザー

Intelハードウェア(Gaudi AIアクセラレータ、Xeonプロセッサ、データセンターGPUなど)を含む、さまざまなプラットフォーム(AMD、ARM、NVIDIA GPUなど)上でディープラーニングモデルをデプロイする必要があるAIエンジニアおよび研究者向けに設計されています。

主な特徴

  • マルチフレームワーク対応:PyTorch、TensorFlow、JAX すべてで動作。
  • 広範なハードウェア互換性:Intel Gaudi、Core Ultra、Xeon、データセンターGPU向けに最適化。他のCPUおよびGPUにも限定的なサポートあり。
  • LLM/VLM専用機能:LLaMA、Qwen、DeepSeek などのモデルを圧縮するための専用ツール。
  • 最先端の精度サポート:FP8、MXFP8、MXFP4、NVFP4 などの実験的低精度フォーマットをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト