Hugging Face 推理解決方案概覽 2022 年 11 月

TL;DR

Hugging Face 推出了一系列推理服務——免費小工具、免費 API、付費的 Inference Endpoints 與 Spaces——讓開發者能以最小的阻礙與具成本效益的擴展方式測試、原型設計與部署模型。


免費推理小工具:即時模型探索

Inference Widget 內嵌於每個模型頁面,讓使用者上傳樣本資料並只需一次點擊即可取得預測,無需撰寫程式碼。模型會在 Hugging Face 伺服器上按需載入,閒置時則卸載,保持服務免費。此小工具提供模型行為、輸出格式與樣本效能的快速驗證。

「這是快速了解模型功能、輸出以及在資料集少量樣本上表現的最佳方式。模型會在我們的伺服器上按需載入,當不再需要時即會卸載。你不需要撰寫任何程式碼,且此功能是免費的。有什麼不喜歡的呢?」– Julien Simon

免費推理 API:開發用單行 HTTP 呼叫

Inference API 為小工具提供動力,並提供簡易的 HTTP 端點。透過送出包含模型識別碼、輸入資料與 Hub 令牌的 POST 請求,開發者即可在數秒內取得預測。

curl https://api-inference.huggingface.co/models/xlm-roberta-base \
    -X POST \
    -d '{"inputs": "The answer to the universe is <mask>."}' \
    -H "Authorization: Bearer HF_TOKEN"

Key characteristics:

  • 無需自訂伺服器或容器。
  • 可立即切換模型以快速比較。
  • 免費使用層,受速率限制。
  • 由於速率限制與缺乏 SLA 保證,不建議用於生產工作負載。

使用 Inference Endpoints 進行生產部署:安全、可擴展、按使用付費

Inference Endpoints 為任何 Hub 模型提供受管理的生產級部署層。使用者可選擇 AWS 或 Azure 區域、CPU 或 GPU 實例,並啟用自動擴展。價格起始為每小時 $0.06。

安全等級

等級 存取 典型用途
公開 開放的網際網路存取,無驗證 公開示範,開放 API
受保護 需要有效的 Hugging Face 令牌 受控的公開 API
私有 隔離子網路,僅能透過私有雲連結存取 嚴格合規,內部服務

端點 UI 顯示健康、擴展與成本指標,簡化成本‑效能調校。

「Inference Endpoints 讓你能在安全且可擴展的基礎設施上部署任何 hub 模型,並託管於你選擇的 AWS 或 Azure 區域。額外設定包括 CPU 與 GPU 託管、內建自動擴展等。這使得尋找合適的成本/效能比變得簡單。」

Spaces:將模型轉換為互動式應用程式

Spaces 結合模型推理與前端 UI 框架(例如 Gradio),打造可分享的示範或輕量級生產服務。使用者可直接從 UI 升級硬體至先進的 Intel CPU 或 NVIDIA GPU。

Key points:

  • 提供完整的 Web UI 供模型互動。
  • 支援硬體升級以提升效能。
  • 適合展示模型或構建簡易的內部工具。

入門指南:從探索到部署

  1. 登入 Hugging Face Hub 並瀏覽模型目錄。
  2. 在模型頁面使用 Inference Widget 即時測試預測。
  3. 點擊 Deploy 產生免費 Inference API 的程式碼。
  4. 若為生產環境,從相同的部署流程中選擇 Inference EndpointsSpaces
  5. 在 Hugging Face 論壇提供回饋。

背景與影響

這些服務降低了研究與生產之間的門檻,使開發者能快速迭代最先進的模型——包括 Transformers、Diffusers 以及其他架構——同時透過 Intel 贊助的 CPU 推理控制成本。分層的方式(免費小工具/API → 付費端點/Spaces)符合典型的機器學習專案生命週期,從概念驗證到企業部署。


欲了解更多細節,請參閱官方 Hugging Face 部落格文章以及各服務的相關文件連結。

SUMMARY: Hugging Face 宣布了一套免費與付費的推理選項——包括小工具、API、Inference Endpoints 與 Spaces——以簡化模型測試、部署與生產規模擴展。

TITLE: Hugging Face 推理解決方案概覽 2022 年 11 月

Sources