Google Cloud TPU 在 Hugging Face 推理端點與 Spaces 上的應用
Hugging Face 已將 Google Cloud TPU v5e 支援整合至 Inference Endpoints 與 Spaces,讓 AI 開發者能利用 Google 的自訂 AI 硬體加速應用程式。此整合提供了一個具可擴展性且具成本效益的方案,用於部署與服務大型語言模型(LLMs)以及 AI 驅動的示範。
TPU v5e 在 Hugging Face 推理端點的整合
Google Cloud TPU v5e 現已成為 Hugging Face Inference Endpoints 的硬體選項,讓在受管基礎設施上無縫部署生成式 AI 模型成為可能。使用者可透過在 us-west1 區域選擇 Google Cloud Platform 來存取這些 TPU。
可用的 TPU 配置與定價
Inference Endpoints 提供三種初始的 TPU v5e 實例配置:
- v5litepod-1:1 核心,16 GB 記憶體($1.375/小時)
- v5litepod-4:4 核心,64 GB 記憶體($5.50/小時)
- v5litepod-8:8 核心,128 GB 記憶體($11.00/小時)
對於參數量最高 20 億的模型,v5litepod-1 配置已足夠。對於更大的模型,建議使用 v5litepod-4 或 v5litepod-8 配置,以避免記憶體預算問題並降低延遲。
技術實作與模型支援
為了促進在 Google TPU 上部署 Hugging Face 模型,開發了以下技術元件:
- Optimum TPU:一個開源函式庫,旨在簡化在 Google TPU 上訓練與部署 Hugging Face 模型。
- TGI Integration:Inference Endpoints 結合 Optimum TPU 與 Text Generation Inference(TGI)在 TPU 硬體上提供 LLM 服務。
- Supported Architectures:初始支援包括 Gemma、Llama 與 Mistral 等熱門模型架構。
TPU v5e 在 Hugging Face Spaces 的支援
開發者現在可以將 Hugging Face Spaces 升級為在 TPU v5e 實例上執行,從而建立與託管高效能的 AI 示範與應用程式。Spaces 的硬體配置與定價與 Inference Endpoints 完全相同:
- v5litepod-1:1 核心,16 GB 記憶體($1.375/小時)
- v5litepod-4:4 核心,64 GB 記憶體($5.50/小時)
- v5litepod-8:1 核心,16 GB 記憶體($1.375/小時) — 根據來源的更正:來源列出 v5litepod-8 為 8 核心與 128 GB 記憶體($11.00/小時),適用於兩項服務。
使用者可於其特定 Space 的設定選單中,選擇欲使用的 TPU 配置,以啟用 TPU 支援。