ONNX Runtime을 사용한 Hugging Face 모델 가속화
Hugging Face와 ONNX Runtime은 Hugging Face Hub에서 130,000개 이상의 모델을 가속화하기 위해 통합되었으며, 다양한 머신러닝 아키텍처에 걸쳐 추론 성능을 크게 향상시켰습니다. 이 통합을 통해 사용자는 크로스 플랫폼 가속을 활용하여 대기 시간을 줄이고, 대규모 언어 모델(LLM)과 클라우드 모델 모두에 대한 배포를 최적화할 수 있습니다.
모델 추론에서의 성능 향상
ONNX Runtime은 Hugging Face 모델에 대해 상당한 지연 시간 개선을 제공합니다. 예를 들어, whisper-tiny 모델은 ONNX Runtime을 사용할 때 PyTorch와 비교하여 추론당 평균 지연 시간이 최대 74.30% 향상됨을 보여줍니다.
지원되는 모델 아키텍처
ONNX Runtime은 90개 이상의 Hugging Face 모델 아키텍처를 지원합니다. 이 지원은 업로드된 모델 수를 기준으로 가장 인기 있는 11가지 아키텍처를 포함하여 Hub에서 가장 널리 사용되는 모델까지 확장됩니다.
| 모델 아키텍처 | 대략적인 모델 수 |
|---|---|
| BERT | 28,180 |
| GPT2 | 14,060 |
| DistilBERT | 11,540 |
| RoBERTa | 10,800 |
| T5 | 10,450 |
| Wav2Vec2 | 6,560 |
| Stable-Diffusion | 5,880 |
| XLM-RoBERTa | 5,100 |
| Whisper | 4,400 |
| BART | 3,590 |
| Marian | 2,840 |
ONNX Runtime 기술 개요
ONNX Runtime은 ONNX 지원이 있는 모델을 특히 포함하여 다양한 모델을 가속화하도록 설계된 크로스 플랫폼 머신러닝 도구입니다. Hugging Face와 협력하여 ONNX Runtime은 플랫폼에서 가장 인기 있는 모델 아키텍처가 고성능 실행을 위해 최적화되도록 보장합니다.