Hugging Face 與 Cloudflare Workers AI 整合

Hugging Face 與 Cloudflare 推出了「Deploy on Cloudflare Workers AI」整合,使開發者能以無伺服器 API 方式存取受歡迎的開源模型。此整合利用 Cloudflare 全球的無伺服器 GPU 網路,免除開發者管理 GPU 基礎設施或為閒置容量付費的需求。

Note: 截至 2024 年 11 月,此整合已不再提供。建議使用者改用 Hugging Face Inference API、Inference Endpoints,或其他部署選項。

為開發者提供的無伺服器 GPU 推論

Cloudflare Workers AI 提供低成本、無伺服器的解決方案,以因應 GPU 稀缺與部署伺服器固定成本等常見挑戰。透過按請求付費的計價模式,開發者僅需為實際使用的運算付費。

為說明成本效益,Hugging Face 舉例說明一個使用 Meta Llama 2 7B 的檢索增強生成 (RAG) 應用,每天約收到 1,000 筆請求(每筆 1,000 個輸入 token 與 100 個輸出 token),此類應用的每日成本約為 1 美元。

技術實作與工作流程

開發者可透過直接整合於 Hugging Face Hub 的精簡流程,將 Hugging Face 模型部署至 Cloudflare Workers AI。

部署流程

  1. Model Selection: 使用者可在 Hugging Face Hub 上的精選 Cloudflare Collection 中找到受支援的模型,包括 Llama、Gemma 與 Mistral。
  2. Deployment Trigger: 在模型頁面上,使用者選取「Deploy」選單,並選擇「Cloudflare Workers AI」。
  3. Configuration: 介面會提供針對所選模型的具體說明與程式碼片段。

整合選項

部署完成後,可透過以下兩種主要方式存取此整合:

  • Workers AI REST API: 需要定義 ACCOUNT_IDAPI_TOKEN 變數。
  • Cloudflare AI SDK: 可直接於 Cloudflare Workers 中整合。

基礎設施與模型支援

此整合由 Hugging Face 的 Text Generation Inference(TGI)等正式解決方案提供支援。模型部署於 Cloudflare 邊緣資料中心的最先進 GPU 上。雖然最初上線時已包含多個受歡迎的開源模型,但特定模型的可用性取決於 Cloudflare Workers AI 生態系統的支援情況;若模型的部署選單中未出現「Cloudflare Workers AI」選項,則目前不受支援。

SUMMARY: Hugging Face 整合 Cloudflare Workers AI,為受歡迎的開源模型提供無伺服器 GPU 推論,讓開發者能以按請求付費的計價模式部署 AI 應用。

TITLE: Hugging Face 與 Cloudflare Workers AI 整合

Sources