Intel と Hugging Face の機械学習ハードウェアアクセラレーションに関するパートナーシップ
Intel と Hugging Face は、Intel の AI ソフトウェアと Xeon ハードウェアを Hugging Face エコシステムに統合することで、機械学習ハードウェアアクセラレーションの民主化を目指して提携しました。この協業は Optimum Intel オープンソースライブラリを中心としており、Intel プラットフォーム上での Transformer モデルの最適化プロセスをシンプルにします。
Optimum Intel を用いた Transformer アクセラレーションの効率化
Optimum Intel は、より広範な Hugging Face Optimum ライブラリの専門コンポーネントであり、機械学習実務者向けのレイテンシ最適化の複雑さを軽減するよう設計されています。これは Intel Neural Compressor (INC) を基盤としており、複数のディープラーニングフレームワークにわたるネットワーク圧縮技術の統一インターフェースを提供するオープンソースライブラリです。
- Quantization: モデルパラメータのビット幅を(例:32ビット浮動小数点から8ビット整数へ)削減し、メモリと計算リソースの要件を減らします。
- Pruning: 予測結果への影響が最小のモデルパラメータをゼロにしたり削除したりします。
- Knowledge Distillation: パフォーマンスを維持しながらモデルを圧縮する手法です。
Optimum Intel は、初心者から上級者まで、既成のスクリプトや最小限のコード変更でこれらの最先端最適化手法を適用できるようにします。
パフォーマンスベンチマークとハードウェアサポート
このパートナーシップは、Intel の加速AI基盤、特に Intel Xeon Scalable CPU プラットフォームとそれに付随するハードウェア最適化AIソフトウェアツールを活用しています。
両組織の過去の協働により、顕著なパフォーマンス向上が示されています:
- Inference Latency: Intel Xeon Ice Lake CPU 上の DistilBERT で、1 桁ミリ秒のレイテンシが達成されました。
- Training Efficiency: Habana Gaudi アクセラレータのサポートにより、GPU と比較して最大 40% の価格性能向上が得られます。
ケーススタディ:DistilBERT の事後トレーニング量子化
Optimum Intel の有用性を示すため、靴レビュー分類用にファインチューニングした DistilBERT モデルでケーススタディを実施しました。このプロセスは、事後トレーニング動的量子化を利用してモデルのメモリと計算フットプリントを縮小しました。
技術的実装
optimum.intel.neural_compressor モジュールの INCQuantizer を使用し、10 回の試行で最大 5% の精度低下を許容する設定でモデルを量子化しました。このプロセスは標準の Linear レイヤーを DynamicQuantizedLinear レイヤーに置き換えました。
結果
38 個の Linear と 2 個の Embedding 演算子の量子化により、以下のパフォーマンス変化が得られました:
- Execution Speed: 量子化モデルの評価ステップは、元のモデルに比べて 1.34 倍速くなりました。
- Accuracy: 精度は 0.574 から 0.546 に低下しました。
- Latency: 評価プロセスの所要時間は 13.1534 秒から 9.7695 秒へ短縮されました。
今後の展望
このパートナーシップは、Optimum Intel ライブラリの機能拡張を継続し、事後トレーニング量子化を超えて、より高度なプルーニングや量子化手法を取り入れ、Intel Xeon CPU と Intel AI ライブラリを利用するユーザーに最高の効率性を提供することを目指します。