Hugging Face AWS Inferentia2 整合

Hugging Face 已將 AWS Inferentia2(Inf2)加速整合至其部署生態系統,讓使用者能透過 Amazon SageMaker 部署超過 100,000 個模型,並在 Hugging Face 推理端點中提供直接的 Inf2 實例選項。此整合旨在透過 optimum-neuron 開源庫,為生產環境的 AI 工作負載提供高效能與成本效益。

在 Amazon SageMaker 上擴充的模型支援

AWS 客戶現在可以使用 Amazon SageMaker,在 AWS Inferentia2 實例上部署來自 Hugging Face Hub 的超過 100,000 個公開模型。此擴充包括對六種機器學習任務和 14 種新模型架構的支援:

  • 支援的架構: albert, bert, camembert, convbert, deberta, deberta-v2, distilbert, electra, roberta, mobilebert, mpnet, vit, xlm, 以及 xlm-roberta
  • 支援的任務: 文本分類、文本生成、標記分類、填充遮罩、問答以及特徵抽取。

此部署路徑讓使用者能利用 SageMaker 的受管功能,進行 MLOps、治理與模型微調。

Hugging Face 推理端點中的 AWS Inferentia2

Hugging Face 推理端點現在將 AWS Inferentia2 實例作為配置選項,讓使用者能一鍵部署 Hub 模型。針對大型語言模型(LLM)如 Llama 3,提供兩種特定的實例規格:

  • Inf2-small: 2 核心、32 GB 記憶體,價格為每小時 $0.75(針對 Llama 3 8B 優化)。
  • Inf2-xlarge: 24 核心、384 GB 記憶體,價格為每小時 $12(針對 Llama 3 70B 優化)。

推理端點以秒為單位計費,具備自動副本自動擴縮與「縮至零」功能,以優化成本。

透過 Text Generation Inference (TGI) 的技術實作

對於 LLM,推理端點使用 Text Generation Inference for Neuron(TGI)。TGI 為生產規模的 LLM 服務而設計,支援持續批次處理與串流。此外,透過 TGI 部署的 LLM 與 OpenAI SDK Messages API 相容,讓開發者在不修改現有應用程式碼的情況下切換端點。

未來路線圖

Hugging Face 正在擴大 Inference Endpoints 中與 AWS Inferentia2 相容的模型範圍。計畫中的更新包括:

  • 新模型類型: 支援 Diffusion 與 Embedding 模型,以實現加速的圖像生成與語意搜尋/推薦系統。
  • 效能優化: 持續改進 Neuronx 上的 Text Generation Inference(TGI),提升 LLM 部署的效率與速度。

Sources