Fetch AI 基础设施迁移:使用 Hugging Face 和 AWS 整合工具

执行摘要

Fetch,一家为 1800 万活跃月度用户提供消费奖励的公司,已从依赖第三方 AI 提供商转向内部 AI 平台。通过利用 Hugging Face 和 Amazon Web Services (AWS),Fetch 将约 15 种不同的 AI 工具整合,用于每日处理超过 1100 万张收据,实现了开发时间降低 30%,处理延迟降低 50%。

从第三方 AI 向内部机器学习的转变

Fetch 之前使用第三方 AI 解决方案来扫描和处理收据,公司将其描述为“黑箱”。这种依赖带来了业务风险,并限制了数据洞察的细粒度,导致 Fetch 无法向业务合作伙伴提供客户如何参与促销的详细信息。

为了解决此问题,Fetch 在内部构建了自己的机器学习(ML)和 AI 专业能力。公司在八个月内完成了转型——比原计划的 12 个月提前四个月——通过使用 AWS 资源进行模型训练。

技术实现与工具

Fetch 通过整合多项关键技术和项目来实现其新的 AI 基础设施:

Hugging Face 集成

Fetch 通过 AWS Marketplace 参与了 Hugging Face 专家加速计划。Hugging Face 提供了咨询服务和知识转移,使 Fetch 的工程师能够有效使用开源 transformer 模型,提升文档 AI 模型中的实体解析和语义搜索能力。

AWS 基础设施

  • Amazon SageMaker:用于在完全托管的基础设施和工作流中构建、训练和部署机器学习模型。
  • AWS Inferentia:作为加速器部署,以实现深度学习(DL)推理应用的高性能和低成本。

部署策略

为确保迁移期间的稳定性,Fetch 使用了“影子流水线”。该系统在第三方解决方案仍在运行的情况下,将每日 1100 万张收据重新处理到新的机器学习流水线中,用于审计和分析,从而在新系统成为主要数据源之前验证其准确性。

关键成果与性能提升

转向自主管理的 AI 堆栈为 Fetch 带来了显著的运营和技术改进:

  • 延迟降低:收据上传的处理延迟降低了 50%,提升了用户体验和客户留存。
  • 开发效率:在 Hugging Face 的指导和其开源资源的使用下,开发时间约缩短了 30%。
  • 训练速度:模型训练时间从数天或数周缩短至仅数小时。
  • 数据控制:通过消除“黑箱”依赖,Fetch 获得了对数据的完全控制,并能够提取业务合作伙伴所需的特定粒度洞察。

Sources