Hugging Face 私有 Hub 介绍

Hugging Face 已推出 Private Hub(现已重新命名为 Enterprise Hub),为组织提供一个安全且合规的生态系统,用于构建、协作和部署机器学习(ML)模型。该平台旨在通过统一 ML 生命周期来解决行业常见瓶颈——如重复工作、非标准工作流以及将模型从研究转向生产的困难——从而在同一地点实现这些目标。

Private Hub 生态系统

Private Hub 允许公司在私有环境中使用完整的 Hugging Face 生态系统。这确保了敏感数据和模型保留在公司自己的服务器上,同时利用以下核心组件:

核心资产

  • Models:访问跨多个领域(NLP、计算机视觉、语音等)的最先进预训练模型,可通过迁移学习针对特定用例进行微调。
  • Datasets:为专有数据集提供托管,并配备高效的数据操作和查看工具。
  • Spaces:一个用于构建和托管交互式 ML 演示应用的框架,可向利益相关者展示工作并收集早期反馈。

集成工具

  • AutoTrain:一种无代码 AutoML 解决方案,可自动微调、评估和部署模型。
  • Evaluate:一个工具,可在任意数据集上使用多种指标评估模型,无需编写代码。
  • Inference API:一个系统,通过简单的 API 调用部署私有模型进行推理,免除手动 Docker 或 Kubernetes 管理的需求。
  • Collaboration Tools:基于 Git 的仓库,支持拉取请求和讨论,以促进代码审查和版本控制。

部署选项

为满足不同的安全和合规需求,Hugging Face 为 Private Hub 提供了三种部署模型:

  1. Managed Private Hub (SaaS):托管在 Hugging Face 拥有的隔离虚拟私有服务器(VPC)中,消除基础设施管理负担。
  2. On-cloud Private Hub:部署在客户自己的云账户(AWS、Azure 或 GCP)中,提供对基础设施的完整管理权限。
  3. On-prem Private Hub:部署在客户自有的物理基础设施上,适用于合规要求最严格的情况。注意:截至 2023 年 6 月,随着向 Enterprise Hub 的转型,已停止提供本地部署。

加速 ML 路线图:实用工作流

Hugging Face 通过金融分析师报告分析的使用案例展示了 Private Hub 的价值,演示了从研究到生产的流畅转化:

1. 快速模型开发

团队无需从头训练模型,而是可以将预训练模型(例如 FinBERT)克隆到 Private Hub 中,并使用自定义的专有数据集进行微调。通过使用 AutoTrain,团队可以自动训练并比较多个候选模型(例如 25 种不同版本),根据指标和 Inference Widget 识别出表现最佳的模型。

2. 利益相关者验证

使用 Spaces,团队可以在几分钟内构建交互式演示应用(例如约 51 行代码),以向业务利益相关者验证最小可行产品(MVP),从而基于真实反馈实现更快的迭代。

3. 生产规模化

模型经合规团队通过模型卡批准后,可使用 Inference API 部署到生产环境。这使团队能够通过简单的 HTTP 请求(约 12 行代码)在大规模和实时情况下进行推理,绕过 MLOps 基础设施管理的复杂性。

向 Enterprise Hub 迁移

截至 2023 年 6 月,Private Hub 已更名为 Enterprise Hub。该托管解决方案将 SaaS 的便利性与企业安全相结合,提供高级用户管理、单点登录(SSO),并能够在包括云端和本地在内的多种计算选项上部署诸如 Inference Endpoints 等服务。

Sources