Hugging Face와 Google Cloud Vertex AI Model Garden 통합

Hugging Face와 Google Cloud는 "Deploy on Google Cloud"라는 새로운 통합을 소개했으며, 이를 통해 개발자는 자체 Google Cloud 계정 내에서 수천 개의 오픈 파운데이션 모델을 API 엔드포인트로 배포할 수 있습니다. 이 통합은 Vertex AI 또는 Google Kubernetes Engine(GKE)을 활용하여 모델 탐색에서 프로덕션 배포로의 전환을 간소화합니다.

Vertex AI 및 GKE를 통한 간소화된 배포

개발자는 이제 기본 인프라나 서버를 관리하지 않고도 오픈 모델을 프로덕션 준비된 엔드포인트에 배포할 수 있습니다. 이는 두 가지 주요 진입점을 통해 구현됩니다:

Hugging Face Hub에서 배포

"text-generation-inference" 태그가 지정된 모델의 경우, 사용자는 모델 카드에서 "Deploy" 메뉴를 선택하고 "Google Cloud"를 선택할 수 있습니다. 이 동작은 사용자를 Google Cloud Console로 리디렉션하며, 여기서 단 한 번의 클릭으로 모델을 Vertex AI에 배포하거나 매니페스트 템플릿을 사용해 GKE Kubernetes 클러스터에 배포할 수 있습니다.

Vertex Model Garden에서 배포

Google Cloud 사용자는 Vertex Model Garden의 "Deploy From Hugging Face" 옵션을 사용하여 Google Cloud 콘솔 내에서 모델을 직접 탐색하고 배포할 수 있습니다. 이 기능을 통해 사용자는 모델 ID를 검색하고, 사전 테스트된 하드웨어 구성으로 수백 개의 인기 오픈 LLM에 접근하며, Vertex AI 또는 GKE 중 하나에 필요한 배포 설정을 미리 채울 수 있습니다.

기술 인프라 및 호환성

이 통합은 Hugging Face의 프로덕션 솔루션인 Text Generation Inference(TGI)를 활용하여 가장 인기 있는 오픈 모델에 대한 추론을 지원합니다. 보안 및 인증을 보장하기 위해, 게이트된 모델을 배포하는 사용자는 모델 다운로드를 승인하기 위해 자신의 Hugging Face 액세스 토큰을 제공해야 합니다.

AI 빌더를 위한 전략적 목표

이 파트너십은 오픈 생성 AI 모델을 안전하고 신뢰성 있게 배포하는 데 필요한 시간과 리소스를 줄이는 것을 목표로 합니다. Vertex AI 생태계 내에서 Hugging Face 모델을 위한 전용 구성 및 자산을 제공함으로써, 이 통합은 생성 AI 애플리케이션을 구축하는 개발자에게서 인프라 관리 부담을 제거합니다.

Sources