Hugging Face AWS Inferentia2 集成

Hugging Face 已将 AWS Inferentia2(Inf2)加速集成到其部署生态系统中,允许用户通过 Amazon SageMaker 部署超过 100,000 个模型,并在 Hugging Face 推理端点中提供直接的 Inf2 实例选项。此集成旨在利用 optimum-neuron 开源库,为生产 AI 工作负载提供高性能和成本效益。

在 Amazon SageMaker 上扩展的模型支持

AWS 客户现在可以使用 Amazon SageMaker 在 AWS Inferentia2 实例上部署来自 Hugging Face Hub 的超过 100,000 个公共模型。此扩展包括对六类机器学习任务和 14 种新模型架构的支持:

  • Supported Architectures: albert, bert, camembert, convbert, deberta, deberta-v2, distilbert, electra, roberta, mobilebert, mpnet, vit, xlm, and xlm-roberta
  • Supported Tasks: 文本分类、文本生成、标记分类、填充掩码、问答和特征提取。

此部署路径使用户能够利用 SageMaker 的托管功能进行 MLOps、治理以及模型微调。

Hugging Face 推理端点中的 AWS Inferentia2

Hugging Face 推理端点现在将 AWS Inferentia2 实例作为配置选项,支持一键部署 Hub 模型。针对 Llama 3 等大型语言模型(LLM),提供两种特定实例规格:

  • Inf2-small: 2 核心、32 GB 内存,价格为 $0.75/小时(针对 Llama 3 8B 进行优化)。
  • Inf2-xlarge: 24 核心、384 GB 内存,价格为 $12/小时(针对 Llama 3 70B 进行优化)。

推理端点按秒计费,具备自动副本弹性伸缩和“零规模”功能,以优化成本。

通过文本生成推理 (TGI) 的技术实现

对于 LLM,推理端点使用 Text Generation Inference for Neuron(TGI)。TGI 旨在实现生产规模的 LLM 服务,支持持续批处理和流式传输。此外,通过 TGI 部署的 LLM 与 OpenAI SDK Messages API 兼容,开发者可以在不修改现有应用代码的情况下切换端点。

未来路线图

Hugging Face 正在扩大在推理端点中兼容 AWS Inferentia2 的模型范围。计划的更新包括:

n* New Model Types: 支持扩散模型和嵌入模型,以实现加速的图像生成和语义搜索/推荐系统。

  • Performance Optimization: 持续改进 Neuronx 上的 Text Generation Inference(TGI),提升 LLM 部署的效率和速度。

Sources