Hugging Face AWS Inferentia2 통합

Hugging Face는 AWS Inferentia2(Inf2) 가속을 자체 배포 생태계에 통합했습니다. 이를 통해 사용자는 Amazon SageMaker를 통해 100,000개 이상의 모델을 배포할 수 있으며, Hugging Face Inference Endpoints에서 직접 Inf2 인스턴스 옵션을 선택할 수 있습니다. 이 통합은 optimum-neuron 오픈소스 라이브러리를 활용하여 프로덕션 AI 워크로드에 높은 성능과 비용 효율성을 제공하는 것을 목표로 합니다.

Amazon SageMaker에서 확장된 모델 지원

AWS 고객은 이제 Amazon SageMaker를 사용해 AWS Inferentia2 인스턴스에서 Hugging Face Hub의 100,000개 이상의 공개 모델을 배포할 수 있습니다. 이번 확장에는 여섯 가지 머신러닝 작업과 14개의 새로운 모델 아키텍처가 포함됩니다:

  • 지원되는 아키텍처: albert, bert, camembert, convbert, deberta, deberta-v2, distilbert, electra, roberta, mobilebert, mpnet, vit, xlm, xlm-roberta.
  • 지원되는 작업: 텍스트 분류, 텍스트 생성, 토큰 분류, 마스크 채우기, 질문 답변, 특징 추출.

이 배포 경로를 통해 사용자는 SageMaker의 관리형 MLOps, 거버넌스 및 모델 파인튜닝 기능을 활용할 수 있습니다.

Hugging Face Inference Endpoints에서 AWS Inferentia2

Hugging Face Inference Endpoints는 이제 AWS Inferentia2 인스턴스를 구성 옵션에 포함시켜 Hub 모델을 원클릭으로 배포할 수 있게 했습니다. Llama 3과 같은 대형 언어 모델(LLM)을 위해 두 가지 특정 인스턴스 유형이 제공됩니다:

  • Inf2-small: 2코어 및 32GB 메모리, 시간당 $0.75 가격 (Llama 3 8B에 최적화).
  • Inf2-xlarge: 24코어 및 384GB 메모리, 시간당 $12 가격 (Llama 3 70B에 최적화).

Inference Endpoints는 초 단위 과금이며 자동 복제본 자동 스케일링 및 "scale to zero" 기능을 제공해 비용을 최적화합니다.

Text Generation Inference (TGI)를 통한 기술 구현

LLM의 경우 Inference Endpoints는 Neuron용 Text Generation Inference(TGI)를 사용합니다. TGI는 프로덕션 규모 LLM 서빙을 위해 설계되었으며 연속 배치와 스트리밍을 지원합니다. 또한 TGI를 통해 배포된 LLM은 OpenAI SDK Messages API와 호환되어 기존 애플리케이션 코드를 수정하지 않고도 엔드포인트를 전환할 수 있습니다.

향후 로드맵

Hugging Face는 Inference Endpoints 내에서 AWS Inferentia2와 호환되는 모델 범위를 확대하고 있습니다. 예정된 업데이트는 다음과 같습니다:

  • 새 모델 유형: Diffusion 및 Embedding 모델 지원으로 가속화된 이미지 생성 및 의미 검색/추천 시스템을 가능하게 함.
  • 성능 최적화: Neuronx에서 Text Generation Inference (TGI)를 지속적으로 개선하여 LLM 배포의 효율성과 속도를 높임.

Sources