Hugging Face 与 Cloudflare Workers AI 集成
Hugging Face 与 Cloudflare 推出了 “Deploy on Cloudflare Workers AI” 集成,使开发者能够将流行的开源模型作为无服务器 API 使用。该集成通过利用 Cloudflare 全球的无服务器 GPU 网络,消除了开发者管理 GPU 基础设施或为闲置容量付费的需求。
注意: 截至 2024 年 11 月,此集成已不再可用。建议用户切换到 Hugging Face Inference API、Inference Endpoints 或其他部署选项。
开发者的无服务器 GPU 推理
Cloudflare Workers AI 提供了一种低成本、无服务器的解决方案,以应对 GPU 稀缺和部署服务器所带来的固定成本等常见挑战。通过采用按请求付费的定价模式,开发者仅为实际使用的计算资源付费。
为说明成本效益,Hugging Face 提供了一个检索增强生成(RAG)应用的示例,该应用使用 Meta Llama 2 7B,每天大约收到 1,000 次请求(每次 1,000 个输入 token 和 100 个输出 token);此类应用的每日成本约为 1 美元。
技术实现与工作流
开发者可以通过直接集成在 Hugging Face Hub 中的简化流程,将 Hugging Face 模型部署到 Cloudflare Workers AI。
部署流程
- 模型选择:用户可以在 Hugging Face Hub 上的精选 Cloudflare Collection 中找到受支持的模型,包括 Llama、Gemma 和 Mistral。
- 部署触发:在模型页面,用户选择 “Deploy” 菜单并选择 “Cloudflare Workers AI”。
- 配置:界面为所选模型提供具体的说明和代码片段。
集成选项
部署完成后,可通过两种主要方式访问该集成:
- Workers AI REST API:需要定义
ACCOUNT_ID和API_TOKEN变量。 - Cloudflare AI SDK:允许在 Cloudflare Workers 中直接集成。
基础设施与模型支持
该集成由 Hugging Face 的 Text Generation Inference(TGI)等生产解决方案提供支持。模型托管在部署于 Cloudflare 边缘数据中心的最先进 GPU 上。虽然最初发布时包含了流行的开源模型,但具体模型的可用性取决于 Cloudflare Workers AI 生态系统的支持;在部署菜单中没有 “Cloudflare Workers AI” 选项的模型目前不受支持。