Hugging Face NVIDIA NIM API(无服务器)发布与停用
TL;DR
Hugging Face 为 Enterprise Hub 用户推出了 NVIDIA NIM API(无服务器),通过标准的兼容 OpenAI 的 API,实现了在 NVIDIA DGX Cloud H100 GPU 上按需付费的开源大语言模型无服务器推理。该服务简化了高性能生成式 AI 的访问,并按秒计费 GPU 使用费用。
什么是 NVIDIA NIM API(无服务器)?
NVIDIA NIM API(无服务器)是 Hugging Face Hub 的一项新服务,允许 Enterprise Hub 组织在 NVIDIA 的 DGX Cloud H100 Tensor Core GPU 上运行流行的开源生成模型(如 Llama 3 和 Mistral)的推理,而无需管理任何基础设施。该服务基于 Hugging Face 与 NVIDIA 之间已有的合作,并补充了此前宣布的 Train on DGX Cloud 产品。
服务工作原理
前置条件
- 成为 Hugging Face Enterprise Hub 组织的成员。
- 一个针对该组织的细粒度访问令牌(通过 Hugging Face Access Tokens 页面创建)。
步骤工作流
- 创建细粒度令牌 – 仅生成具有 “org permissions” 的令牌;不需要其他作用域。
- 定位受支持的 NIM 模型 – 浏览 NVIDIA NIM Collection 或模型的 Hub 页面。例如,
meta-llama/Meta-Llama-3-8B-Instruct卡片显示一个 Deploy 菜单,其中的 NVIDIA NIM API(无服务器) 选项提供现成的代码片段。 - 发送推理请求 – 使用兼容 OpenAI 的 SDK(
openaiPython 包),基准 URL 为https://huggingface.co/api/integrations/dgx/v1,并将细粒度令牌作为 API 密钥。该 API 目前支持chat.completions.create和models.list两个端点。
from openai import OpenAI
client = OpenAI(
base_url="https://huggingface.co/api/integrations/dgx/v1",
api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)
chat = client.chat.completions.create(
model="meta-llama/Meta-Llama-3-8B-Instruct",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Count to 500"}
],
stream=True,
max_tokens=1024
)
for chunk in chat:
print(chunk.choices[0].delta.content, end="")
可以使用 models.list 端点列出所有当前可用的 NIM 模型。
支持的模型与定价
该服务仅在 NVIDIA H100 GPU 上运行,价格为 每小时 $8.25(≈ 每秒 $0.0023)。费用按请求计算,依据所需 GPU 数量和请求延迟。
| 模型 ID | H100 GPU 数量 | 典型延迟*(500 输入,100 输出) | 每次请求的近似费用 |
|---|---|---|---|
| meta-llama/Meta-Llama-3-8B-Instruct | 1 | 1 s | $0.0023 |
| meta-llama/Meta-Llama-3-70B-Instruct | 4 | 2 s | $0.0184 |
| meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 | 8 | 5 s | $0.0917 |
*延迟在 DGX Cloud H100 硬件上测量。
其他受支持的模型包括各种 Mixtral 和 Mistral 变体,每个模型对应特定的 GPU 数量(例如,Mixtral‑8x22B‑Instruct‑v0.1 使用 8 台 H100)。使用费用按 Enterprise Hub 组织的月度计费周期计收,可在 Hub 的计费设置中查看。
技术意义
- 无服务器抽象 – 开发者无需再配置、扩展或维护 GPU 集群;推理通过简单的 HTTP 调用触发。
- 标准化 API – 通过采用 OpenAI API 架构,现有工具和库可直接复用,无需更改代码。
- 成本透明 – 按秒计费的 GPU 价格使预算更可预测,尤其是对突发性工作负载。
- 性能优势 – 利用 NVIDIA DGX Cloud H100 GPU 以及即将推出的 TensorRT‑LLM 集成,可实现比通用云 GPU 更低的延迟和更高的吞吐量。
未来路线图
Hugging Face 宣布计划将 API 的功能扩展至 chat.completions.create 和 models.list 之外,增加更多端点能力并扩大支持模型目录。即将把 NVIDIA TensorRT‑LLM 集成到 Hugging Face 的文本生成推理(TGI)框架中,预计将进一步提升推理速度,并将在后续发布基准测试和最佳实践指南。
停用通知
更新: 此服务已于 2025 年 4 月 10 日 停止并不可用。用户应采用更新的 Inference Providers 框架以继续获得无服务器推理功能。
上述信息反映了该服务在 2024 年 7 月 29 日宣布时的状态。随后停用意味着该服务已不再运行,但其架构概念仍对理解 Hugging Face 的无服务器 AI 推理方法具有参考价值。