使用 ONNX Runtime 加速 Hugging Face 模型
Hugging Face 和 ONNX Runtime 已经集成,以在 Hugging Face Hub 上加速超过 130,000 个模型,显著提升了各种机器学习架构的推理性能。此集成使用户能够利用跨平台加速来降低延迟并优化部署,以适用于大型语言模型(LLMs)和云模型。
模型推理的性能提升
ONNX Runtime 为 Hugging Face 模型提供了显著的延迟改进。例如,whisper-tiny 模型在使用 ONNX Runtime 相比 PyTorch 时,平均每次推理的延迟提升可达 74.30%。
支持的模型架构
ONNX Runtime 支持超过 90 种 Hugging Face 模型架构。此支持扩展到 Hub 上最广泛使用的模型,包括基于上传模型数量的 11 种最流行架构:
| 模型架构 | 大约模型数量 |
|---|---|
| BERT | 28,180 |
| GPT2 | 14,060 |
| DistilBERT | 11,540 |
| RoBERTa | 10,800 |
| T5 | 10,450 |
| Wav2Vec2 | 6,560 |
| Stable-Diffusion | 5,880 |
| XLM-RoBERTa | 5,100 |
| Whisper | 4,400 |
| BART | 3,590 |
| Marian | 2,840 |
ONNX Runtime 技术概览
ONNX Runtime 是一个跨平台机器学习工具,旨在加速各种模型,特别是那些具有 ONNX 支持的模型。通过与 Hugging Face 合作,ONNX Runtime 确保平台上最流行的模型架构经过优化,以实现高性能执行。