Q8-Chat: Intel Xeon CPU上の効率的な生成AI

Hugging Face と Intel は、8 ビット量子化に SmoothQuant を利用することで、大規模言語モデル(LLM)が Intel Xeon CPU 上で効率的に実行でき、モデルサイズを約 2 倍に削減し、推論レイテンシを大幅に低減しながらもモデル品質を損なわないことを実証しました。

SmoothQuant による LLM 量子化課題の克服

標準的な量子化手法は、LLM ではしばしば失敗します。なぜなら、これらのモデルはすべての層とトークンにわたって特定の活性化チャネルで大きな外れ値を示すためです。活性化をトークン単位で量子化すると、これらの外れ値は通常、値が切り捨てられたり、低振幅の活性化がアンダーフローしたりし、いずれもモデル精度を大幅に低下させます。

SmoothQuant は、重みと活性化に対して共同の数学的変換を適用することでこの問題に対処します。このプロセスは、重みの比率を高めることで活性化における外れ値と非外れ値の比率を低減し、Transformer 層を「量子化に適した」状態にします。これにより、8 ビット整数(INT8)量子化が可能となり、複雑な 16 ビット浮動小数点(FP16/BF16)演算を高速な整数演算に置き換えます。

パフォーマンスと精度のベンチマーク

Intel は、OPT(2.7B および 6.7B)、LLaMA(7B)、Alpaca(7B)、Vicuna(7B)、BloomZ(7.1B)、MPT-7B-chat など、複数の LLM に SmoothQuant-O3 を適用しました。その結果、8 ビット量子化がモデル性能を維持または向上させることが示されました:

  • OPT モデル: これらは SmoothQuant の優れた候補として特定されました。モデルサイズは約 2 倍に削減され、ほとんどのベンチマークで改善が見られ、他はわずかなペナルティのみでした。
  • LLaMA 7B と BloomZ 7.1B: これらのモデルは約 2 倍に圧縮され、タスクの約半数で指標が改善しました。相対的に 3% 超の劣化が見られたタスクは 1 つだけでした。

ハードウェア実装と Q8-Chat

CPU 上での効率的な LLM デプロイは、8 ビット量子化と第 4 世代 Intel Xeon(Sapphire Rapids)ハードウェアを組み合わせることで実現します。

Q8-Chat は、Hugging Face Spaces でホストされているデモで、シングルソケットの Intel Sapphire Rapids CPU(32 コア、バッチサイズ 1)上で動作する ChatGPT ライクな体験を提供します。この構成は、CPU プラットフォーム上でも高品質なチャット体験が実現できることを示し、組織に対して高性能 GPU や複雑な AI アクセラレータにのみ依存するよりも、IT の柔軟性とコストパフォーマンスの向上を提供します。

Hugging Face エコシステムとの統合

これらの手法の導入を簡素化するため、Hugging Face は Optimum Intel ライブラリに Intel Neural Compressor を介してこれらの量子化手法を統合しています。この統合により、開発者は最小限のコードでこれらの効率向上を再現できることを目指しています.

Sources