Hugging Face AWS Inferentia2 整合
Hugging Face 已將 AWS Inferentia2(Inf2)加速整合至其部署生態系統,讓使用者能透過 Amazon SageMaker 部署超過 100,000 個模型,並在 Hugging Face 推理端點中提供直接的 Inf2 實例選項。此整合旨在透過 optimum-neuron 開源庫,為生產環境的 AI 工作負載提供高效能與成本效益。
在 Amazon SageMaker 上擴充的模型支援
AWS 客戶現在可以使用 Amazon SageMaker,在 AWS Inferentia2 實例上部署來自 Hugging Face Hub 的超過 100,000 個公開模型。此擴充包括對六種機器學習任務和 14 種新模型架構的支援:
- 支援的架構:
albert,bert,camembert,convbert,deberta,deberta-v2,distilbert,electra,roberta,mobilebert,mpnet,vit,xlm, 以及xlm-roberta。 - 支援的任務: 文本分類、文本生成、標記分類、填充遮罩、問答以及特徵抽取。
此部署路徑讓使用者能利用 SageMaker 的受管功能,進行 MLOps、治理與模型微調。
Hugging Face 推理端點中的 AWS Inferentia2
Hugging Face 推理端點現在將 AWS Inferentia2 實例作為配置選項,讓使用者能一鍵部署 Hub 模型。針對大型語言模型(LLM)如 Llama 3,提供兩種特定的實例規格:
- Inf2-small: 2 核心、32 GB 記憶體,價格為每小時 $0.75(針對 Llama 3 8B 優化)。
- Inf2-xlarge: 24 核心、384 GB 記憶體,價格為每小時 $12(針對 Llama 3 70B 優化)。
推理端點以秒為單位計費,具備自動副本自動擴縮與「縮至零」功能,以優化成本。
透過 Text Generation Inference (TGI) 的技術實作
對於 LLM,推理端點使用 Text Generation Inference for Neuron(TGI)。TGI 為生產規模的 LLM 服務而設計,支援持續批次處理與串流。此外,透過 TGI 部署的 LLM 與 OpenAI SDK Messages API 相容,讓開發者在不修改現有應用程式碼的情況下切換端點。
未來路線圖
Hugging Face 正在擴大 Inference Endpoints 中與 AWS Inferentia2 相容的模型範圍。計畫中的更新包括:
- 新模型類型: 支援 Diffusion 與 Embedding 模型,以實現加速的圖像生成與語意搜尋/推薦系統。
- 效能優化: 持續改進 Neuronx 上的 Text Generation Inference(TGI),提升 LLM 部署的效率與速度。