Google Cloud TPU를 Hugging Face Inference Endpoints 및 Spaces에 적용
Hugging Face는 Google Cloud TPU v5e 지원을 Inference Endpoints와 Spaces에 통합하여 AI 개발자가 Google의 맞춤형 AI 하드웨어를 사용해 애플리케이션을 가속화할 수 있게 했습니다. 이 통합을 통해 대규모 언어 모델(LLM) 및 AI 기반 데모를 배포하고 서비스하는 데 있어 확장 가능하고 비용 효율적인 대안을 제공합니다.
Hugging Face Inference Endpoints에서 TPU v5e 통합
Google Cloud TPU v5e가 이제 Hugging Face Inference Endpoints의 하드웨어 옵션으로 제공되어 관리형 인프라에서 생성형 AI 모델을 원활하게 배포할 수 있습니다. 사용자는 us-west1 지역에서 Google Cloud Platform을 선택하여 해당 TPU에 접근할 수 있습니다.
사용 가능한 TPU 구성 및 가격
Inference Endpoints는 초기 TPU v5e 인스턴스 구성 3가지를 제공합니다:
- v5litepod-1: 1 코어, 16 GB 메모리 ($1.375/시간)
- v5litepod-4: 4 코어, 64 GB 메모리 ($5.50/시간)
- v5litepod-8: 8 코어, 128 GB 메모리 ($11.00/시간)
2억 파라미터까지의 모델에는 v5litepod-1 구성이 충분합니다. 더 큰 모델의 경우 메모리 예산 문제를 방지하고 지연 시간을 줄이기 위해 v5litepod-4 또는 v5litepod-8 구성을 권장합니다.
기술 구현 및 모델 지원
Google TPU에서 Hugging Face 모델을 배포하기 위해 다음 기술 구성 요소가 개발되었습니다:
- Optimum TPU: Google TPU에서 Hugging Face 모델의 학습 및 배포를 간소화하기 위해 만든 오픈소스 라이브러리.
- TGI Integration: Inference Endpoints는 Optimum TPU와 Text Generation Inference (TGI)를 함께 사용하여 TPU 하드웨어에서 LLM을 서비스합니다.
- Supported Architectures: 초기 지원에는 Gemma, Llama, Mistral과 같은 인기 모델 아키텍처가 포함됩니다.
Hugging Face Spaces에 대한 TPU v5e 지원
개발자는 이제 Hugging Face Spaces를 TPU v5e 인스턴스로 업그레이드하여 고성능 AI 기반 데모와 애플리케이션을 만들고 호스팅할 수 있습니다. Spaces의 하드웨어 구성 및 가격은 Inference Endpoints와 동일합니다:
- v5litepod-1: 1 코어, 16 GB 메모리 ($1.375/시간)
- v5litepod-4: 4 코어, 64 GB 메모리 ($5.50/시간)
- v5litepod-8: 1 코어, 16 GB 메모리 ($1.375/시간) — 소스에 따른 정정: 소스에서는 v5litepod-8을 8 코어, 128 GB 메모리 ($11.00/시간)로 양 서비스 모두에 대해 명시하고 있습니다.
사용자는 해당 Space의 Settings 메뉴로 이동하여 원하는 TPU 구성을 선택함으로써 TPU 지원을 활성화할 수 있습니다.