使用 ONNX Runtime 加速 Hugging Face 模型

Hugging Face 和 ONNX Runtime 已整合,以在 Hugging Face Hub 上加速超過 130,000 個模型,顯著提升廣泛機器學習架構的推理效能。此整合使使用者能夠利用跨平台加速來降低延遲並優化部署,適用於大型語言模型 (LLMs) 和雲端模型。

模型推理的效能提升

ONNX Runtime 為 Hugging Face 模型提供了顯著的延遲改進。例如,whisper-tiny 模型在使用 ONNX Runtime 時,相較於 PyTorch,平均每次推理的延遲可減少高達 74.30%。

支援的模型架構

ONNX Runtime 支援超過 90 個 Hugging Face 模型架構。此支援擴展到 Hub 上最廣泛使用的模型,包括根據上傳模型數量排名的 11 個最熱門架構:

模型架構 模型近似數量
BERT 28,180
GPT2 14,060
DistilBERT 11,540
RoBERTa 10,800
T5 10,450
Wav2Vec2 6,560
Stable-Diffusion 5,880
XLM-RoBERTa 5,100
Whisper 4,400
BART 3,590
Marian 2,840

ONNX Runtime 技術概覽

ONNX Runtime 是一個跨平台機器學習工具,旨在加速各種模型,尤其是那些具有 ONNX 支援的模型。透過與 Hugging Face 合作,ONNX Runtime 確保平台上最熱門的模型架構經過優化,以實現高效能執行。

Sources