Groq 與 Hugging Face 推理提供者的整合
透過 Groq LPU 的高效能推理
Groq 採用專為計算密集且具序列性元件的應用(如大型語言模型(LLM))設計的專用語言處理單元(LPU)。透過克服傳統 GPU 在推理上的限制,LPU 架構提供顯著更低的延遲與更高的吞吐量,因而最佳化於即時 AI 應用。
Groq 提供即時、按使用付費的 API 以存取這些開放可用的模型,現在已作為 Hugging Face Hub 上的推理提供者可供使用。
整合與工作流程
使用者可透過兩種主要介面存取 Groq 的推理功能:Hugging Face 網站 UI 與客戶端 SDK。
網站 UI 設定
在使用者帳號設定中,使用者可管理其推理體驗,方式如下:
- 設定 API 金鑰:使用者可為特定提供者輸入自己的 API 金鑰。若未提供自訂金鑰,請求將透過 Hugging Face 轉送。
- 排序偏好:使用者可設定偏好的提供者順序,該順序決定其在模型頁面小工具與程式碼片段中的顯示方式。
客戶端 SDK 實作
Groq 已整合至 Hugging Face 的 Python 與 JavaScript 客戶端 SDK。
對於 Python 使用者,huggingface_hub 套件(版本 v0.33.0 或來源安裝)可透過指定 provider="groq" 來使用 InferenceClient。
對於 JavaScript 使用者,@huggingface/inference 套件可在 chatCompletion 方法中傳入 provider: "groq" 參數,以實現相同功能。
路由與計費模式
在 Hub 上呼叫推理提供者有兩種不同模式:
- 自訂金鑰模式:請求直接使用使用者自己的 API 金鑰發送至推理提供者。在此模式下,使用者由提供者(例如 Groq)直接計費。
- 由 HF 路由模式:請求透過 Hugging Face Hub 進行驗證。此模式下,使用者不需要提供者專屬的 token,費用會計入 Hugging Face 帳戶。Hugging Face 直接轉嫁提供者成本,且不加收額外費用。
訂閱福利
- PRO 使用者:Hugging Face PRO 訂閱者每月可獲得等值 $2 的推理點數,可於不同提供者間使用。
- 免費使用者:已登入的免費使用者可獲得少量的免費推理配額。