Hugging Face AWS Inferentia2 集成
Hugging Face 已将 AWS Inferentia2(Inf2)加速集成到其部署生态系统中,允许用户通过 Amazon SageMaker 部署超过 100,000 个模型,并在 Hugging Face 推理端点中提供直接的 Inf2 实例选项。此集成旨在利用 optimum-neuron 开源库,为生产 AI 工作负载提供高性能和成本效益。
在 Amazon SageMaker 上扩展的模型支持
AWS 客户现在可以使用 Amazon SageMaker 在 AWS Inferentia2 实例上部署来自 Hugging Face Hub 的超过 100,000 个公共模型。此扩展包括对六类机器学习任务和 14 种新模型架构的支持:
- Supported Architectures:
albert,bert,camembert,convbert,deberta,deberta-v2,distilbert,electra,roberta,mobilebert,mpnet,vit,xlm, andxlm-roberta。 - Supported Tasks: 文本分类、文本生成、标记分类、填充掩码、问答和特征提取。
此部署路径使用户能够利用 SageMaker 的托管功能进行 MLOps、治理以及模型微调。
Hugging Face 推理端点中的 AWS Inferentia2
Hugging Face 推理端点现在将 AWS Inferentia2 实例作为配置选项,支持一键部署 Hub 模型。针对 Llama 3 等大型语言模型(LLM),提供两种特定实例规格:
- Inf2-small: 2 核心、32 GB 内存,价格为 $0.75/小时(针对 Llama 3 8B 进行优化)。
- Inf2-xlarge: 24 核心、384 GB 内存,价格为 $12/小时(针对 Llama 3 70B 进行优化)。
推理端点按秒计费,具备自动副本弹性伸缩和“零规模”功能,以优化成本。
通过文本生成推理 (TGI) 的技术实现
对于 LLM,推理端点使用 Text Generation Inference for Neuron(TGI)。TGI 旨在实现生产规模的 LLM 服务,支持持续批处理和流式传输。此外,通过 TGI 部署的 LLM 与 OpenAI SDK Messages API 兼容,开发者可以在不修改现有应用代码的情况下切换端点。
未来路线图
Hugging Face 正在扩大在推理端点中兼容 AWS Inferentia2 的模型范围。计划的更新包括:
n* New Model Types: 支持扩散模型和嵌入模型,以实现加速的图像生成和语义搜索/推荐系统。
- Performance Optimization: 持续改进 Neuronx 上的 Text Generation Inference(TGI),提升 LLM 部署的效率和速度。