Hugging Face 推理提供者整合
Hugging Face 已將四個無伺服器推理提供者——fal、Replicate、SambaNova 和 Together AI——直接整合到 Hub 的模型頁面和客戶端 SDK 中。此舉將 Hub 從託管自己的無伺服器推理 API 轉變為提供對多樣化專門無伺服器提供者生態系統的統一存取。
統一無伺服器推理存取
用戶現在可以直接從 Hub 存取多種模型的無伺服器推理。此整合使得探索和原型製作如 DeepSeek-R1 和 FLUX.1-dev 等模型變得更容易,無需管理單獨的基礎設施。
網站 UI 整合
在 Hub 的使用者帳戶設定中,用戶可以透過兩種主要方式管理他們的推理體驗:
- 自訂 API 金鑰: 用戶可以為特定提供者設置自己的 API 金鑰。使用這些金鑰的請求將直接發送到提供者。
- 提供者偏好: 用戶可以根據偏好排序提供者,這決定了他們在模型頁面小工具和程式碼片段中的顯示方式。
路由模式
透過此系統呼叫推理 API 有兩種不同的模式:
- 自訂金鑰模式: 呼叫將直接使用用戶對應提供者的自身 API 金鑰發送到推理提供者。
- 由 HF 路由: 請求將透過 Hugging Face 進行路由。在此模式下,用戶不需要提供者特定的權杖,費用將直接應用於 Hugging Face 帳戶。
技術實作與 SDK
Python 整合
使用 huggingface_hub 庫(v0.28.0 或更新版本),開發者可以在 InferenceClient 中指定提供者:
from huggingface_hub import InferenceClient
client = InferenceClient(
provider="together",
api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)
completion = client.chat.completions.create(
model="deepseek-ai/DeepSeek-R1",
messages=[{"role": "user", "content": "What is the capital of France?"}],
max_tokens=500
)
JavaScript 整合
使用 @huggingface/inference 的開發者可以在 chatCompletion 方法中傳遞 provider 參數:
import { HfInference } from "@huggingface/inference\);\n\nconst client = new HfInference("xxxxxxxxxxxxxxxxxxxxxxxx");\n\nconst chatCompletion = await client.chatCompletion({\n model: "deepseek-ai/DeepSeek-R1",\n provider: "together",\n max_tokens: 500\n});
HTTP 路由代理
Hugging Face 在 huggingface.co 域名下公開一個路由代理,透過 URL 結構 https://router.huggingface.co/{provider} 實現與 OpenAI 相容的 API 呼叫。
計費與積分
計費取決於所選的路由模式:
- 直接請求: 用戶直接由推理提供者使用其提供者帳戶進行計費。
- 路由請求: 用戶支付由 Hugging Face 轉發的標準提供者 API 費率,無額外加成。
Hugging Face PRO 用戶每月可獲得價值 2 美元的推理積分,可跨提供者使用。已登入的免費用戶將獲得少量免費推理配額。
社區回饋與觀點
社區對該公告的討論凸顯了幾個爭議點和技術障礙:
"先前的專業版提供了 20,000 次請求。現在沒有了。真遺憾。"
"我認為這是個錯誤的決定。我支付了 9 美元,但只使用了 2 美元。我之前有每日 20k 的限額。"
用戶回報說 InferenceClient.__init__() 在未更新到最新庫版本時會收到意外的關鍵字參數,此外在代表用戶呼叫推理提供者時還會出現 403 Forbidden 權限錯誤。