Hugging Face と Google Cloud Vertex AI Model Garden の統合

Hugging Face と Google Cloud は「Deploy on Google Cloud」という新しい統合を発表し、開発者が自分の Google Cloud アカウント内で数千のオープン基盤モデルを API エンドポイントとしてデプロイできるようにしました。この統合は、Vertex AI または Google Kubernetes Engine (GKE) を利用することで、モデルの探索から本番デプロイまでの移行を簡素化します。

Vertex AI と GKE による簡素化デプロイ

開発者は、基盤となるインフラやサーバーを管理することなく、オープンモデルを本番向けエンドポイントにデプロイできるようになりました。これは、主に 2 つのエントリーポイントを通じて実現されます。

Hugging Face Hub からのデプロイ

「text-generation-inference」タグが付いたモデルについては、モデルカードの「Deploy」メニューを選択し、「Google Cloud」を選ぶことができます。この操作によりユーザーは Google Cloud Console にリダイレクトされ、ワンクリックでモデルを Vertex AI にデプロイするか、マニフェストテンプレートを使用して GKE の Kubernetes クラスタにデプロイできます。

Vertex Model Garden からのデプロイ

Google Cloud のユーザーは、Vertex Model Garden の「Deploy From Hugging Face」オプションを使用して、Google Cloud コンソール内で直接モデルを検索・デプロイできます。この機能により、モデル ID を検索し、事前にテストされたハードウェア構成を持つ数百の人気オープン LLM にアクセスし、Vertex AI または GKE のいずれかに必要なデプロイ設定を自動で入力できます。

技術インフラと互換性

この統合は、Hugging Face の本番向けソリューションである Text Generation Inference (TGI) を活用し、最も人気のあるオープンモデルの推論を実現します。セキュリティと認可を確保するため、ゲート付きモデルをデプロイするユーザーは、モデルのダウンロードを認可するために自分の Hugging Face アクセストークンを提供する必要があります。

AI ビルダー向けの戦略的目標

このパートナーシップは、オープンな生成 AI モデルを安全かつ信頼性高くデプロイするために必要な時間とリソースを削減することを目的としています。Vertex AI エコシステム内で Hugging Face モデル向けの専用設定やアセットを提供することで、生成 AI アプリケーションを構築する開発者からインフラ管理の負担を取り除きます。

Sources