Google Cloud TPU 在 Hugging Face 推理端点和 Spaces 上的使用

Hugging Face 已将 Google Cloud TPU v5e 支持集成到推理端点和 Spaces 中,允许 AI 开发者使用 Google 定制的 AI 硬件加速应用程序。此集成为部署和服务大型语言模型(LLMs)以及 AI 驱动的演示提供了可扩展且具成本效益的替代方案。

Hugging Face 推理端点中的 TPU v5e 集成

Google Cloud TPU v5e 现已作为 Hugging Face 推理端点的硬件选项,可在托管基础设施上实现生成式 AI 模型的无缝部署。用户可通过在 us-west1 区域选择 Google Cloud Platform 来访问这些 TPU。

可用的 TPU 配置及定价

  • v5litepod-1:1 核心,16 GB 内存($1.375/小时)
  • v5litepod-4:4 核心,64 GB 内存($5.50/小时)
  • v5litepod-8:8 核心,128 GB 内存($11.00/小时)

对于参数量最高达 20 亿的模型,v5litepod-1 配置已足够。对于更大的模型,建议使用 v5litepod-4 或 v5litepod-8 配置,以避免内存预算问题并降低延迟。

技术实现与模型支持

为促进在 Google TPU 上部署 Hugging Face 模型,开发了以下技术组件:

  1. Optimum TPU:一个开源库,用于简化在 Google TPU 上训练和部署 Hugging Face 模型。
  2. TGI Integration:推理端点结合 Optimum TPU 与 Text Generation Inference(TGI)在 TPU 硬件上提供 LLM 服务。
  3. Supported Architectures:初始支持包括 Gemma、Llama 和 Mistral 等流行模型架构。

Hugging Face Spaces 对 TPU v5e 的支持

开发者现在可以将 Hugging Face Spaces 升级为在 TPU v5e 实例上运行,从而创建和托管高性能的 AI 驱动演示和应用。Spaces 的硬件配置和定价与推理端点提供的完全相同:

  • v5litepod-1:1 核心,16 GB 内存($1.375/小时)
  • v5litepod-4:4 核心,64 GB 内存($5.50/小时)
  • v5litepod-8:1 核心,16 GB 内存($1.375/小时) — 根据来源的更正:该来源列出 v5litepod-8 为 8 核心、128 GB 内存($11.00/小时),两项服务均如此。

用户可通过进入其特定 Space 的设置菜单并选择所需的 TPU 配置来启用 TPU 支持。

Sources