Hugging Face と Cloudflare Workers AI の統合

Hugging Face と Cloudflare は "Deploy on Cloudflare Workers AI" 統合を開始し、開発者が人気のオープンモデルをサーバーレス API として利用できるようにしました。この統合により、開発者は GPU インフラを管理したり、アイドル状態の容量に対して支払う必要がなくなり、Cloudflare のグローバルなサーバーレス GPU ネットワークを活用できます。

Note: 2024年11月時点で、この統合は利用できなくなっています。ユーザーは Hugging Face Inference API、Inference Endpoints、またはその他のデプロイオプションへ切り替えることが推奨されます。

開発者向けサーバーレス GPU 推論

Cloudflare Workers AI は、GPU の不足やサーバー導入に伴う固定コストという一般的な課題に対し、低コストでサーバーレスなソリューションを提供します。従量課金モデルを採用しているため、開発者は実際に使用した計算リソース分だけ支払います。

コスト効率を示す例として、Hugging Face は Retrieval-Augmented Generation (RAG) アプリケーションを提示しています。このアプリは Meta Llama 2 7B を使用し、1日あたり約 1,000 件のリクエスト(入力トークン 1,000、出力トークン 100)を受け取ると、概算で 1 日あたり約 $1 のコストになるとしています。

技術的実装とワークフロー

開発者は Hugging Face Hub に直接統合されたシンプルなプロセスを通じて、Cloudflare Workers AI 上に Hugging Face モデルをデプロイできます。

デプロイプロセス

  1. Model Selection: ユーザーは Hugging Face Hub の特設 Cloudflare Collection 内で、Llama、Gemma、Mistral などのサポート対象モデルを見つけられます。
  2. Deployment Trigger: モデルページで "Deploy" メニューを選択し、"Cloudflare Workers AI" を選びます。
  3. Configuration: インターフェースは選択したモデル向けの具体的な手順とコードスニペットを提供します。

統合オプション

デプロイ後、統合は以下の 2 つの主要手段で利用できます:

  • Workers AI REST API: ACCOUNT_IDAPI_TOKEN 変数の定義が必要です。
  • Cloudflare AI SDK: Cloudflare Workers 内で直接統合できます。

インフラストラクチャとモデルサポート

この統合は Hugging Face の Text Generation Inference (TGI) などの本番向けソリューションによって支えられています。モデルは Cloudflare のエッジデータセンターに配置された最新鋭 GPU 上でホストされます。初期リリースでは人気のオープンモデルが含まれていましたが、特定モデルの利用可否は Cloudflare Workers AI エコシステム内でのサポート状況に依存します。デプロイメニューに "Cloudflare Workers AI" オプションが表示されないモデルは現在サポートされていません。

Sources