ONNX Runtime を使用した Hugging Face モデルの高速化

Hugging Face と ONNX Runtime は統合され、Hugging Face Hub 上の 130,000 を超えるモデルの高速化が行われ、幅広い機械学習アーキテクチャにおける推論パフォーマンスが大幅に向上しました。この統合により、ユーザーはクロスプラットフォームの高速化を活用してレイテンシーを削減し、大規模言語モデル (LLM) とクラウドモデルの両方に対してデプロイを最適化できるようになります。

モデル推論におけるパフォーマンス向上

ONNX Runtime は、Hugging Face モデルに対して大幅なレイテンシー改善を提供します。たとえば、whisper-tiny モデルは、PyTorch と比較して ONNX Runtime を使用すると、推論ごとの平均レイテンシーが最大 74.30% 向上します。

サポートされているモデルアーキテクチャ

ONNX Runtime は 90 を超える Hugging Face モデルアーキテクチャをサポートします。このサポートは、Hub 上で最も広く使用されているモデルに及び、アップロードされたモデル数に基づく上位 11 の人気アーキテクチャを含みます:

モデルアーキテクチャ 概算モデル数
BERT 28,180
GPT2 14,060
DistilBERT 11,540
RoBERTa 10,800
T5 10,450
Wav2Vec2 6,560
Stable-Diffusion 5,880
XLM-RoBERTa 5,100
Whisper 4,400
BART 3,590
Marian 2,840

ONNX Runtime の技術概要

ONNX Runtime は、さまざまなモデル、特に ONNX サポートがあるモデルの高速化を目的としたクロスプラットフォームの機械学習ツールです。Hugging Face との協力により、ONNX Runtime はプラットフォーム上の最も人気のあるモデルアーキテクチャが高パフォーマンスでの実行に最適化されることを保証します。

Sources