使用 ONNX Runtime 加速 Hugging Face 模型
Hugging Face 和 ONNX Runtime 已整合,以在 Hugging Face Hub 上加速超過 130,000 個模型,顯著提升廣泛機器學習架構的推理效能。此整合使使用者能夠利用跨平台加速來降低延遲並優化部署,適用於大型語言模型 (LLMs) 和雲端模型。
模型推理的效能提升
ONNX Runtime 為 Hugging Face 模型提供了顯著的延遲改進。例如,whisper-tiny 模型在使用 ONNX Runtime 時,相較於 PyTorch,平均每次推理的延遲可減少高達 74.30%。
支援的模型架構
ONNX Runtime 支援超過 90 個 Hugging Face 模型架構。此支援擴展到 Hub 上最廣泛使用的模型,包括根據上傳模型數量排名的 11 個最熱門架構:
| 模型架構 | 模型近似數量 |
|---|---|
| BERT | 28,180 |
| GPT2 | 14,060 |
| DistilBERT | 11,540 |
| RoBERTa | 10,800 |
| T5 | 10,450 |
| Wav2Vec2 | 6,560 |
| Stable-Diffusion | 5,880 |
| XLM-RoBERTa | 5,100 |
| Whisper | 4,400 |
| BART | 3,590 |
| Marian | 2,840 |
ONNX Runtime 技術概覽
ONNX Runtime 是一個跨平台機器學習工具,旨在加速各種模型,尤其是那些具有 ONNX 支援的模型。透過與 Hugging Face 合作,ONNX Runtime 確保平台上最熱門的模型架構經過優化,以實現高效能執行。