Hugging Face 推理解决方案概览 2022年11月

TL;DR

Hugging Face 推出了多种推理服务——免费小部件、免费 API、付费推理端点和 Spaces——让开发者能够以最小的摩擦和成本效益的扩展方式测试、原型化和部署模型。


免费推理小部件:即时模型探索

推理小部件位于每个模型页面上,允许用户上传示例数据并通过一次点击获取预测,无需编写代码。模型按需在 Hugging Face 服务器上加载,空闲时卸载,从而保持服务免费。该小部件提供对模型行为、输出格式和示例性能的快速检查。

“这是快速了解模型功能、输出以及在数据集少量样本上表现的最佳方式。模型按需在我们的服务器上加载,使用完毕后即卸载。您无需编写任何代码,且此功能免费。还有什么不喜欢的?” – Julien Simon

免费推理 API:一行 HTTP 调用用于开发

推理 API 为小部件提供动力,并提供一个简易的 HTTP 端点。通过发送包含模型标识、输入负载和 Hub 令牌的 POST 请求,开发者可以在几秒钟内获得预测。

curl https://api-inference.huggingface.co/models/xlm-roberta-base \
    -X POST \
    -d '{"inputs": "The answer to the universe is <mask>."}' \
    -H "Authorization: Bearer HF_TOKEN"

关键特性:

  • 无需自定义服务器或容器。
  • 即时模型切换,以便快速比较。
  • 免费使用层,受速率限制。
  • 由于速率限制和缺乏 SLA 保证,不建议用于生产工作负载。

使用推理端点进行生产:安全、可扩展、按需付费

推理端点为任何 Hub 模型提供受管的生产级部署层。用户可以选择 AWS 或 Azure 区域,选择 CPU 或 GPU 实例,并启用自动扩展。定价起始为每小时 $0.06。

安全级别

级别 访问 典型使用
公开 开放的互联网访问,无需认证 公开演示,开放 API
受保护 需要有效的 Hugging Face 令牌 受控的公共 API
私有 隔离子网,仅通过私有云链接可达 严格合规,内部服务

端点 UI 显示健康、扩展和成本指标,简化成本‑性能调优。

“推理端点让您能够在安全且可扩展的基础设施上部署任何 Hub 模型,托管于您选择的 AWS 或 Azure 区域。额外设置包括 CPU 与 GPU 托管、内置自动扩展等。这使得寻找合适的成本/性能比变得轻而易举。”

Spaces:将模型转化为交互式应用

Spaces 将模型推理与前端 UI 框架(例如 Gradio)结合,创建可共享的演示或轻量级生产服务。用户可以直接在 UI 中将硬件升级为高级 Intel CPU 或 NVIDIA GPU。

关键要点:

  • 提供完整的网页 UI 以进行模型交互。
  • 支持硬件升级以提升性能。
  • 适合展示模型或构建简单的内部工具。

入门指南:从探索到部署

  1. 登录 Hugging Face Hub 并浏览模型目录。
  2. 在模型页面使用推理小部件即时测试预测。
  3. 点击 Deploy 生成免费推理 API 的代码。
  4. 对于生产环境,从相同的部署流程中选择 Inference EndpointsSpaces
  5. 在 Hugging Face 论坛提供反馈。

背景与影响

这些产品降低了研究与生产之间的壁垒,使开发者能够在最先进的模型(包括 Transformers、Diffusers 以及其他架构)上快速迭代,同时通过 Intel 赞助的 CPU 推理控制成本。分层方式(免费小部件/API → 付费端点/Spaces)与典型的机器学习项目生命周期相匹配,从概念验证到企业部署。


欲了解更多详情,请参阅官方 Hugging Face 博客文章以及每项服务的相关文档链接。

Sources