Hugging Face 推理端点
Hugging Face 推出了 Inference Endpoints,这是一项托管服务,旨在简化将机器学习模型从 Hugging Face Hub 部署到云基础设施的过程。该服务消除了将模型打包进容器、配置基础设施以及构建预测 API 的运维负担,使开发者能够在几分钟内从模型页面直接转到可投入生产的端点。
托管部署工作流
Inference Endpoints 允许直接从 Hugging Face Hub 部署模型。用户可以选择模型,挑选首选的云提供商(例如 AWS)和区域(例如 eu-west-1),并指定硬件需求,例如 GPU 实例。
关键配置选项包括:
- Autoscaling:用户可以选择性地配置服务根据需求自动扩缩。
- Custom Containers:该服务支持通过自定义容器进行部署,以满足特定需求。
- Task Support:该服务支持广泛的机器学习任务,包括图像分类。
安全性与访问控制
Inference Endpoints 提供三种不同的安全级别,以控制谁可以访问已部署的模型:
- Public:端点托管在公共 Hugging Face 子网中,任何互联网用户均可在无需身份验证的情况下访问。
- Protected:端点仍托管在公共 Hugging Face 子网中,但访问需要有效的组织令牌。
- Private:端点托管在私有 Hugging Face 子网中,无法通过公共互联网访问。访问受限于用户自己的 AWS 账户,通过 AWS PrivateLink 创建的 VPC 端点,实现对特定 VPC 和子网的访问控制。
监控与集成
已部署的端点提供集成工具,用于监控性能和调试:
- Analytics Tab:提供实时端点指标,以跟踪请求成功率和失败率。
- Logs Tab:提供详细的执行日志,包括不支持的内容类型错误信息(例如缺少
Content-Type头)。 - API Access:端点可通过使用 Python 或
curl的标准 HTTP 请求调用,在受保护和私有配置下需要使用 Bearer 令牌进行身份验证。
生产使用案例
Inference Endpoints 旨在用于生产级、符合 HIPAA 标准的部署。例如,慢性护理管理平台 Phamily 使用该服务加速 Transformer 模型的部署,同时保持严格的合规标准。