Hugging Face 推理提供者整合

Hugging Face 已將四個無伺服器推理提供者——fal、Replicate、SambaNova 和 Together AI——直接整合到 Hub 的模型頁面和客戶端 SDK 中。此舉將 Hub 從託管自己的無伺服器推理 API 轉變為提供對多樣化專門無伺服器提供者生態系統的統一存取。

統一無伺服器推理存取

用戶現在可以直接從 Hub 存取多種模型的無伺服器推理。此整合使得探索和原型製作如 DeepSeek-R1 和 FLUX.1-dev 等模型變得更容易,無需管理單獨的基礎設施。

網站 UI 整合

在 Hub 的使用者帳戶設定中,用戶可以透過兩種主要方式管理他們的推理體驗:

  • 自訂 API 金鑰: 用戶可以為特定提供者設置自己的 API 金鑰。使用這些金鑰的請求將直接發送到提供者。
  • 提供者偏好: 用戶可以根據偏好排序提供者,這決定了他們在模型頁面小工具和程式碼片段中的顯示方式。

路由模式

透過此系統呼叫推理 API 有兩種不同的模式:

  1. 自訂金鑰模式: 呼叫將直接使用用戶對應提供者的自身 API 金鑰發送到推理提供者。
  2. 由 HF 路由: 請求將透過 Hugging Face 進行路由。在此模式下,用戶不需要提供者特定的權杖,費用將直接應用於 Hugging Face 帳戶。

技術實作與 SDK

Python 整合

使用 huggingface_hub 庫(v0.28.0 或更新版本),開發者可以在 InferenceClient 中指定提供者:

from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="together",
    api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-R1", 
    messages=[{"role": "user", "content": "What is the capital of France?"}], 
    max_tokens=500
)

JavaScript 整合

使用 @huggingface/inference 的開發者可以在 chatCompletion 方法中傳遞 provider 參數:

import { HfInference } from "@huggingface/inference\);\n\nconst client = new HfInference("xxxxxxxxxxxxxxxxxxxxxxxx");\n\nconst chatCompletion = await client.chatCompletion({\n    model: "deepseek-ai/DeepSeek-R1",\n    provider: "together",\n    max_tokens: 500\n});

HTTP 路由代理

Hugging Face 在 huggingface.co 域名下公開一個路由代理,透過 URL 結構 https://router.huggingface.co/{provider} 實現與 OpenAI 相容的 API 呼叫。

計費與積分

計費取決於所選的路由模式:

  • 直接請求: 用戶直接由推理提供者使用其提供者帳戶進行計費。
  • 路由請求: 用戶支付由 Hugging Face 轉發的標準提供者 API 費率,無額外加成。

Hugging Face PRO 用戶每月可獲得價值 2 美元的推理積分,可跨提供者使用。已登入的免費用戶將獲得少量免費推理配額。

社區回饋與觀點

社區對該公告的討論凸顯了幾個爭議點和技術障礙:

"先前的專業版提供了 20,000 次請求。現在沒有了。真遺憾。"

"我認為這是個錯誤的決定。我支付了 9 美元,但只使用了 2 美元。我之前有每日 20k 的限額。"

用戶回報說 InferenceClient.__init__() 在未更新到最新庫版本時會收到意外的關鍵字參數,此外在代表用戶呼叫推理提供者時還會出現 403 Forbidden 權限錯誤。

Sources