使用 ONNX Runtime 加速 Hugging Face 模型

Hugging Face 和 ONNX Runtime 已经集成,以在 Hugging Face Hub 上加速超过 130,000 个模型,显著提升了各种机器学习架构的推理性能。此集成使用户能够利用跨平台加速来降低延迟并优化部署,以适用于大型语言模型(LLMs)和云模型。

模型推理的性能提升

ONNX Runtime 为 Hugging Face 模型提供了显著的延迟改进。例如,whisper-tiny 模型在使用 ONNX Runtime 相比 PyTorch 时,平均每次推理的延迟提升可达 74.30%。

支持的模型架构

ONNX Runtime 支持超过 90 种 Hugging Face 模型架构。此支持扩展到 Hub 上最广泛使用的模型,包括基于上传模型数量的 11 种最流行架构:

模型架构 大约模型数量
BERT 28,180
GPT2 14,060
DistilBERT 11,540
RoBERTa 10,800
T5 10,450
Wav2Vec2 6,560
Stable-Diffusion 5,880
XLM-RoBERTa 5,100
Whisper 4,400
BART 3,590
Marian 2,840

ONNX Runtime 技术概览

ONNX Runtime 是一个跨平台机器学习工具,旨在加速各种模型,特别是那些具有 ONNX 支持的模型。通过与 Hugging Face 合作,ONNX Runtime 确保平台上最流行的模型架构经过优化,以实现高性能执行。

Sources