AWS Inferentia2와 함께 Hugging Face Transformers 가속화

TL;DR

Hugging Face는 AWS와 협력하여 새로운 전용 추론 가속기인 AWS Inferentia2용 Transformer 모델을 최적화했습니다. 이 협업을 통해 개발자는 복잡한 수동 모델 슬라이싱이나 분산 기술 없이도 대규모 모델을 훨씬 낮은 지연 시간과 높은 처리량으로 배포할 수 있습니다.

AWS Inferentia2의 기능 및 성능

AWS Inferentia2는 Inferentia1의 후속 제품으로, 모델 추론의 비용과 속도를 최적화하도록 설계되었습니다. 이는 이전 제품 및 유사한 GPU 인스턴스에 비해 상당한 성능 향상을 제공합니다.

성능 향상

  • Inferentia1과 비교: Inferentia2 칩은 처리량을 4배 증가시키고 지연 시간을 10배 감소시킵니다.
  • NVIDIA A10G (G5 인스턴스)와 비교: Amazon EC2 Inf2 인스턴스는 처리량이 최대 2.6배 향상되고, 지연 시간이 8.1배 감소하며, 유사한 G5 인스턴스에 비해 와트당 성능이 50% 향상됩니다.

확장성 및 메모리

Inf2 인스턴스는 1개에서 12개까지 Inferentia2 칩을 포함하는 다양한 크기로 제공됩니다. 이러한 칩은 분산 추론을 위해 직접 칩 간 연결을 활용합니다. 가장 큰 인스턴스 크기인 inf2.48xlarge는 GPT-3 또는 BLOOM과 같이 최대 1750억 개의 파라미터를 가진 모델을 로드할 수 있는 충분한 메모리를 제공합니다.

Hugging Face와의 통합

개발 복잡성을 줄이기 위해 Hugging Face는 optimum neuron 라이브러리를 제공합니다. AWS Neuron SDK로 구동되는 이 통합을 통해 사용자는 단 한 줄의 코드로 Inferentia2용 모델을 컴파일할 수 있어, 수동 모델 수정이나 슬라이싱이 필요하지 않습니다.

벤치마크 결과

Hugging Face는 배치 크기 1과 시퀀스 길이 8~512를 사용하여 여섯 가지 모델 아키텍처(BERT-base, BERT-Large, RoBERTa-base, DistilBERT, ALBERT-base, ViT-base)에서 144개의 실험을 수행했습니다. 벤치마크는 inf1.2xlarge (Inferentia1), inf2.xlarge (Inferentia2), g5.2xlarge (NVIDIA A10G GPU)를 비교했습니다.

주요 지연 시간 결과

평균적으로 AWS Inferentia2는 NVIDIA A10G GPU보다 4.5배, Inferentia1 인스턴스보다 4배 더 낮은 지연 시간을 제공합니다.

  • BERT-base: 시퀀스 길이가 256까지일 때, Inferentia2는 다른 설정에 비해 약 6배 우수합니다.
  • Vision Transformer (ViT-base): Inferentia2는 NVIDIA A10G에 비해 2배 더 낮은 지연 시간을 제공하여, 실시간 애플리케이션에서 CNN에서 Transformer로의 전환을 용이하게 합니다.

벤치마크 구성

GPU에서 평가된 모델은 추가 최적화 없이 fp32로 실행되었습니다. 측정된 주요 지표는 p95 지연 시간(전처리 및 후처리를 포함한 단일 예측 시간)과 처리량(고정 시간 내 실행 횟수)입니다.

Sources