Hugging Face 推理解決方案概覽 2022 年 11 月
TL;DR
Hugging Face 推出了一系列推理服務——免費小工具、免費 API、付費的 Inference Endpoints 與 Spaces——讓開發者能以最小的阻礙與具成本效益的擴展方式測試、原型設計與部署模型。
免費推理小工具:即時模型探索
Inference Widget 內嵌於每個模型頁面,讓使用者上傳樣本資料並只需一次點擊即可取得預測,無需撰寫程式碼。模型會在 Hugging Face 伺服器上按需載入,閒置時則卸載,保持服務免費。此小工具提供模型行為、輸出格式與樣本效能的快速驗證。
「這是快速了解模型功能、輸出以及在資料集少量樣本上表現的最佳方式。模型會在我們的伺服器上按需載入,當不再需要時即會卸載。你不需要撰寫任何程式碼,且此功能是免費的。有什麼不喜歡的呢?」– Julien Simon
免費推理 API:開發用單行 HTTP 呼叫
Inference API 為小工具提供動力,並提供簡易的 HTTP 端點。透過送出包含模型識別碼、輸入資料與 Hub 令牌的 POST 請求,開發者即可在數秒內取得預測。
curl https://api-inference.huggingface.co/models/xlm-roberta-base \
-X POST \
-d '{"inputs": "The answer to the universe is <mask>."}' \
-H "Authorization: Bearer HF_TOKEN"
Key characteristics:
- 無需自訂伺服器或容器。
- 可立即切換模型以快速比較。
- 免費使用層,受速率限制。
- 由於速率限制與缺乏 SLA 保證,不建議用於生產工作負載。
使用 Inference Endpoints 進行生產部署:安全、可擴展、按使用付費
Inference Endpoints 為任何 Hub 模型提供受管理的生產級部署層。使用者可選擇 AWS 或 Azure 區域、CPU 或 GPU 實例,並啟用自動擴展。價格起始為每小時 $0.06。
安全等級
| 等級 | 存取 | 典型用途 |
|---|---|---|
| 公開 | 開放的網際網路存取,無驗證 | 公開示範,開放 API |
| 受保護 | 需要有效的 Hugging Face 令牌 | 受控的公開 API |
| 私有 | 隔離子網路,僅能透過私有雲連結存取 | 嚴格合規,內部服務 |
端點 UI 顯示健康、擴展與成本指標,簡化成本‑效能調校。
「Inference Endpoints 讓你能在安全且可擴展的基礎設施上部署任何 hub 模型,並託管於你選擇的 AWS 或 Azure 區域。額外設定包括 CPU 與 GPU 託管、內建自動擴展等。這使得尋找合適的成本/效能比變得簡單。」
Spaces:將模型轉換為互動式應用程式
Spaces 結合模型推理與前端 UI 框架(例如 Gradio),打造可分享的示範或輕量級生產服務。使用者可直接從 UI 升級硬體至先進的 Intel CPU 或 NVIDIA GPU。
Key points:
- 提供完整的 Web UI 供模型互動。
- 支援硬體升級以提升效能。
- 適合展示模型或構建簡易的內部工具。
入門指南:從探索到部署
- 登入 Hugging Face Hub 並瀏覽模型目錄。
- 在模型頁面使用 Inference Widget 即時測試預測。
- 點擊 Deploy 產生免費 Inference API 的程式碼。
- 若為生產環境,從相同的部署流程中選擇 Inference Endpoints 或 Spaces。
- 在 Hugging Face 論壇提供回饋。
背景與影響
這些服務降低了研究與生產之間的門檻,使開發者能快速迭代最先進的模型——包括 Transformers、Diffusers 以及其他架構——同時透過 Intel 贊助的 CPU 推理控制成本。分層的方式(免費小工具/API → 付費端點/Spaces)符合典型的機器學習專案生命週期,從概念驗證到企業部署。
欲了解更多細節,請參閱官方 Hugging Face 部落格文章以及各服務的相關文件連結。
SUMMARY: Hugging Face 宣布了一套免費與付費的推理選項——包括小工具、API、Inference Endpoints 與 Spaces——以簡化模型測試、部署與生產規模擴展。
TITLE: Hugging Face 推理解決方案概覽 2022 年 11 月