Hugging Face NVIDIA NIM API(無伺服器)發布與停用
TL;DR
Hugging Face 為 Enterprise Hub 用戶推出了 NVIDIA NIM API(無伺服器),提供即付即用、無伺服器的開源大型語言模型(LLM)推論服務,透過標準的 OpenAI 相容 API 在 NVIDIA DGX Cloud H100 GPU 上執行。此服務簡化了高效能生成式 AI 的存取,同時以每秒 GPU 使用量計費。
NVIDIA NIM API(無伺服器)是什麼?
NVIDIA NIM API(無伺服器)是 Hugging Face Hub 的新服務,讓 Enterprise Hub 組織能在 NVIDIA 的 DGX Cloud H100 Tensor Core GPU 上執行受歡迎的開源生成模型(如 Llama 3 與 Mistral)的推論,且無需管理任何基礎設施。此服務建立在 Hugging Face 與 NVIDIA 之間已有的合作基礎上,並補足先前宣布的 Train on DGX Cloud 方案。
服務運作方式
前置條件
- 成為 Hugging Face Enterprise Hub 組織的成員。
- 具備針對該組織範圍的細粒度存取令牌(可於 Hugging Face Access Tokens 頁面建立)。
步驟說明工作流程
- 建立細粒度令牌 – 只產生具「組織權限」的令牌;不需要其他範圍。
- 尋找支援的 NIM 模型 – 瀏覽 NVIDIA NIM Collection 或模型的 Hub 頁面。例如,
meta-llama/Meta-Llama-3-8B-Instruct卡片會顯示一個 Deploy 功能表,內含 NVIDIA NIM API(無伺服器) 選項,提供即用的程式碼片段。 - 發送推論請求 – 使用相容 OpenAI 的 SDK(
openaiPython 套件),將基礎 URLhttps://huggingface.co/api/integrations/dgx/v1與細粒度令牌作為 API 金鑰。該 API 目前支援chat.completions.create與models.list端點。
from openai import OpenAI
client = OpenAI(
base_url="https://huggingface.co/api/integrations/dgx/v1",
api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)
chat = client.chat.completions.create(
model="meta-llama/Meta-Llama-3-8B-Instruct",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Count to 500"}
],
stream=True,
max_tokens=1024
)
for chunk in chat:
print(chunk.choices[0].delta.content, end="")
models.list 端點可用於列舉目前所有可用的 NIM 模型。
支援的模型與定價
此服務僅在 NVIDIA H100 GPU 上執行,價格為 每小時 $8.25(≈ 每秒 $0.0023)。費用依每次請求所需的 GPU 數量與請求延遲計算。
| 模型 ID | H100 GPU 數量 | 典型延遲*(500 輸入,100 輸出) | 每次請求約成本 |
|---|---|---|---|
| meta-llama/Meta-Llama-3-8B-Instruct | 1 | 1 s | $0.0023 |
| meta-llama/Meta-Llama-3-70B-Instruct | 4 | 2 s | $0.0184 |
| meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 | 8 | 5 s | $0.0917 |
*延遲於 DGX Cloud H100 硬體上測量。
其他支援的模型包括各種 Mixtral 與 Mistral 變體,每種皆對應特定的 GPU 數量(例如,Mixtral‑8x22B‑Instruct‑v0.1 使用 8 顆 H100)。使用費用會依 Enterprise Hub 組織的月度計費週期收取,並可在 Hub 的計費設定中檢視。
技術意義
- Serverless abstraction – 開發者不再需要配置、擴展或維護 GPU 叢集;推論可透過簡單的 HTTP 呼叫觸發。
- Standardized API – 採用 OpenAI API 架構,使現有工具與函式庫可直接重複使用,無需修改程式碼。
- Cost transparency – 每秒 GPU 定價讓預算更可預測,尤其是對於突發性工作負載。
- Performance edge – 利用 NVIDIA DGX Cloud H100 GPU 以及即將推出的 TensorRT‑LLM 整合,能提供比一般雲端 GPU 更低的延遲與更高的吞吐量。
未來路線圖
Hugging Face 宣布計畫將 API 擴展至除 chat.completions.create 與 models.list 之外,加入更多端點功能並擴充支援模型目錄。即將把 NVIDIA TensorRT‑LLM 整合至 Hugging Face 的文字生成推論(TGI)框架,預期進一步提升推論速度,相關效能基準與最佳實踐指南將於日後發布。
停用通知
更新: 此服務已於 2025 年 4 月 10 日 停用且不再可用。建議使用者改採較新的 Inference Providers 框架,以持續取得無伺服器推論功能。
上述資訊反映服務於 2024 年 7 月 29 日公告時的狀態。隨後的停用表示服務已不再運作,但其架構概念仍對了解 Hugging Face 的無伺服器 AI 推論方式具有參考價值。