Hugging Face NVIDIA NIM API(無伺服器)發布與停用

TL;DR

Hugging Face 為 Enterprise Hub 用戶推出了 NVIDIA NIM API(無伺服器),提供即付即用、無伺服器的開源大型語言模型(LLM)推論服務,透過標準的 OpenAI 相容 API 在 NVIDIA DGX Cloud H100 GPU 上執行。此服務簡化了高效能生成式 AI 的存取,同時以每秒 GPU 使用量計費。

NVIDIA NIM API(無伺服器)是什麼?

NVIDIA NIM API(無伺服器)是 Hugging Face Hub 的新服務,讓 Enterprise Hub 組織能在 NVIDIA 的 DGX Cloud H100 Tensor Core GPU 上執行受歡迎的開源生成模型(如 Llama 3 與 Mistral)的推論,且無需管理任何基礎設施。此服務建立在 Hugging Face 與 NVIDIA 之間已有的合作基礎上,並補足先前宣布的 Train on DGX Cloud 方案。

服務運作方式

前置條件

  • 成為 Hugging Face Enterprise Hub 組織的成員。
  • 具備針對該組織範圍的細粒度存取令牌(可於 Hugging Face Access Tokens 頁面建立)。

步驟說明工作流程

  1. 建立細粒度令牌 – 只產生具「組織權限」的令牌;不需要其他範圍。
  2. 尋找支援的 NIM 模型 – 瀏覽 NVIDIA NIM Collection 或模型的 Hub 頁面。例如,meta-llama/Meta-Llama-3-8B-Instruct 卡片會顯示一個 Deploy 功能表,內含 NVIDIA NIM API(無伺服器) 選項,提供即用的程式碼片段。
  3. 發送推論請求 – 使用相容 OpenAI 的 SDK(openai Python 套件),將基礎 URL https://huggingface.co/api/integrations/dgx/v1 與細粒度令牌作為 API 金鑰。該 API 目前支援 chat.completions.createmodels.list 端點。
from openai import OpenAI

client = OpenAI(
    base_url="https://huggingface.co/api/integrations/dgx/v1",
    api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)

chat = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3-8B-Instruct",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Count to 500"}
    ],
    stream=True,
    max_tokens=1024
)

for chunk in chat:
    print(chunk.choices[0].delta.content, end="")

models.list 端點可用於列舉目前所有可用的 NIM 模型。

支援的模型與定價

此服務僅在 NVIDIA H100 GPU 上執行,價格為 每小時 $8.25(≈ 每秒 $0.0023)。費用依每次請求所需的 GPU 數量與請求延遲計算。

模型 ID H100 GPU 數量 典型延遲*(500 輸入,100 輸出) 每次請求約成本
meta-llama/Meta-Llama-3-8B-Instruct 1 1 s $0.0023
meta-llama/Meta-Llama-3-70B-Instruct 4 2 s $0.0184
meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 8 5 s $0.0917

*延遲於 DGX Cloud H100 硬體上測量。

其他支援的模型包括各種 Mixtral 與 Mistral 變體,每種皆對應特定的 GPU 數量(例如,Mixtral‑8x22B‑Instruct‑v0.1 使用 8 顆 H100)。使用費用會依 Enterprise Hub 組織的月度計費週期收取,並可在 Hub 的計費設定中檢視。

技術意義

  • Serverless abstraction – 開發者不再需要配置、擴展或維護 GPU 叢集;推論可透過簡單的 HTTP 呼叫觸發。
  • Standardized API – 採用 OpenAI API 架構,使現有工具與函式庫可直接重複使用,無需修改程式碼。
  • Cost transparency – 每秒 GPU 定價讓預算更可預測,尤其是對於突發性工作負載。
  • Performance edge – 利用 NVIDIA DGX Cloud H100 GPU 以及即將推出的 TensorRT‑LLM 整合,能提供比一般雲端 GPU 更低的延遲與更高的吞吐量。

未來路線圖

Hugging Face 宣布計畫將 API 擴展至除 chat.completions.createmodels.list 之外,加入更多端點功能並擴充支援模型目錄。即將把 NVIDIA TensorRT‑LLM 整合至 Hugging Face 的文字生成推論(TGI)框架,預期進一步提升推論速度,相關效能基準與最佳實踐指南將於日後發布。

停用通知

更新: 此服務已於 2025 年 4 月 10 日 停用且不再可用。建議使用者改採較新的 Inference Providers 框架,以持續取得無伺服器推論功能。


上述資訊反映服務於 2024 年 7 月 29 日公告時的狀態。隨後的停用表示服務已不再運作,但其架構概念仍對了解 Hugging Face 的無伺服器 AI 推論方式具有參考價值。

Sources