Snorkel AI 与 Hugging Face 的企业基础模型集成
TL;DR
Snorkel AI 与 Hugging Face 合作,将 Hugging Face Inference Endpoints 集成到 Snorkel Flow 平台。此合作使企业能够访问庞大的开源基础模型库,并通过 Snorkel 的数据中心化程序化标注将其适配到特定业务场景,从而降低大规模模型的托管和微调成本与复杂度。
通过 Snorkel Flow 适配基础模型
Snorkel Flow 使企业能够通过迭代的“检测与纠正”开发流程,将基础模型适配到特定的生产使用场景。该工作流首先检查所选基础模型在公司数据上的“开箱即用”预测,这些预测作为初始训练标签。
用户识别模型的错误模式,并使用程序化标注进行纠正,这涉及通过启发式规则或提示来更新训练标签。随后在这些更新后的标签上对基础模型进行微调并重新评估。该循环持续进行,直至模型达到部署所需的质量。
Hugging Face 模型与基础设施的集成
Snorkel AI 利用 Hugging Face 为用户提供超过 150,000 个开源模型的访问权限,其中包括 BioBERT、SciBERT 等领域特定模型。这种多样性使用户能够选择最符合其业务需求的基础模型,为初始预测和微调提供快速起点。
为管理这些模型相关的基础设施和成本,Snorkel AI 使用 Hugging Face Inference Endpoints。该服务提供了若干关键技术优势:
- 快速部署: 用户只需几次点击即可创建模型 API,立即使用。
- 成本效率: “暂停与恢复”功能使 Snorkel 仅在客户需要时激活模型 API,闲置时将其置于休眠状态。
- 灵活配置: 该服务提供云提供商选择和安全级别等选项,以满足企业需求。
企业 AI 开发的影响
该合作解决了企业在采用基础模型时面临的主要障碍:自建托管的高成本、缺乏从头训练模型的资源,以及在缺乏治理的情况下将现成模型用于生产的风险。
通过将 Snorkel 的自动化数据标注与 Hugging Face 的开源生态系统相结合,公司能够构建数据中心化的 AI 应用,而无需通常用于手动微调的大规模数据集。正如 Hugging Face 联合创始人兼 CEO Clement Delangue 所言:
“有了 Snorkel AI 与 Hugging Face Inference Endpoints,企业将以开源为核心,加速其数据中心化的 AI 应用。”
此集成使组织能够在利用开源社区进步的同时,保持对客户体验以及针对其使用场景的特定解决方案的控制。