Hugging Face 與 Google Cloud Vertex AI Model Garden 整合
Hugging Face 與 Google Cloud 推出了「Deploy on Google Cloud」這項新整合,讓開發者能在自己的 Google Cloud 帳戶中將數千個開源基礎模型部署為 API 端點。此整合透過使用 Vertex AI 或 Google Kubernetes Engine(GKE),簡化了從模型發現到生產部署的流程。
透過 Vertex AI 與 GKE 簡化部署
開發者現在可以將開源模型部署至可投入生產的端點,而無需管理底層基礎設施或伺服器。這透過兩個主要入口點來實現:
從 Hugging Face Hub 部署
對於標記為「text-generation-inference」的模型,使用者可在模型卡上選取「Deploy」選單,然後選擇「Google Cloud」。此操作會將使用者導向 Google Cloud Console,使用者可一鍵將模型部署至 Vertex AI,或使用 manifest 範本部署至 GKE Kubernetes 叢集。
從 Vertex Model Garden 部署
Google Cloud 使用者可在 Google Cloud 控制台內,透過 Vertex Model Garden 的「Deploy From Hugging Face」選項直接發現並部署模型。此功能讓使用者能搜尋模型 ID、取得數百個受歡迎的開源大型語言模型(LLM)以及預先測試的硬體配置,並為 Vertex AI 或 GKE 預先填寫所需的部署設定。
技術基礎設施與相容性
此整合利用 Hugging Face 的生產解決方案 Text Generation Inference(TGI)為最受歡迎的開源模型提供推論功能。為確保安全性與授權,部署受限模型的使用者必須提供其 Hugging Face 存取令牌,以授權模型下載。
AI 建構者的策略目標
此合作旨在降低安全且可靠部署開源生成式 AI 模型所需的時間與資源。透過在 Vertex AI 生態系統中提供專屬的 Hugging Face 模型配置與資產,此整合可為開發生成式 AI 應用的開發者解除基礎設施管理的負擔。