Hugging Face NVIDIA NIM API(无服务器)发布与停用

TL;DR

Hugging Face 为 Enterprise Hub 用户推出了 NVIDIA NIM API(无服务器),通过标准的兼容 OpenAI 的 API,实现了在 NVIDIA DGX Cloud H100 GPU 上按需付费的开源大语言模型无服务器推理。该服务简化了高性能生成式 AI 的访问,并按秒计费 GPU 使用费用。

什么是 NVIDIA NIM API(无服务器)?

NVIDIA NIM API(无服务器)是 Hugging Face Hub 的一项新服务,允许 Enterprise Hub 组织在 NVIDIA 的 DGX Cloud H100 Tensor Core GPU 上运行流行的开源生成模型(如 Llama 3 和 Mistral)的推理,而无需管理任何基础设施。该服务基于 Hugging Face 与 NVIDIA 之间已有的合作,并补充了此前宣布的 Train on DGX Cloud 产品。

服务工作原理

前置条件

  • 成为 Hugging Face Enterprise Hub 组织的成员。
  • 一个针对该组织的细粒度访问令牌(通过 Hugging Face Access Tokens 页面创建)。

步骤工作流

  1. 创建细粒度令牌 – 仅生成具有 “org permissions” 的令牌;不需要其他作用域。
  2. 定位受支持的 NIM 模型 – 浏览 NVIDIA NIM Collection 或模型的 Hub 页面。例如,meta-llama/Meta-Llama-3-8B-Instruct 卡片显示一个 Deploy 菜单,其中的 NVIDIA NIM API(无服务器) 选项提供现成的代码片段。
  3. 发送推理请求 – 使用兼容 OpenAI 的 SDK(openai Python 包),基准 URL 为 https://huggingface.co/api/integrations/dgx/v1,并将细粒度令牌作为 API 密钥。该 API 目前支持 chat.completions.createmodels.list 两个端点。
from openai import OpenAI

client = OpenAI(
    base_url="https://huggingface.co/api/integrations/dgx/v1",
    api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)

chat = client.chat.completions.create(
    model="meta-llama/Meta-Llama-3-8B-Instruct",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": "Count to 500"}
    ],
    stream=True,
    max_tokens=1024
)

for chunk in chat:
    print(chunk.choices[0].delta.content, end="")

可以使用 models.list 端点列出所有当前可用的 NIM 模型。

支持的模型与定价

该服务仅在 NVIDIA H100 GPU 上运行,价格为 每小时 $8.25(≈ 每秒 $0.0023)。费用按请求计算,依据所需 GPU 数量和请求延迟。

模型 ID H100 GPU 数量 典型延迟*(500 输入,100 输出) 每次请求的近似费用
meta-llama/Meta-Llama-3-8B-Instruct 1 1 s $0.0023
meta-llama/Meta-Llama-3-70B-Instruct 4 2 s $0.0184
meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 8 5 s $0.0917

*延迟在 DGX Cloud H100 硬件上测量。

其他受支持的模型包括各种 Mixtral 和 Mistral 变体,每个模型对应特定的 GPU 数量(例如,Mixtral‑8x22B‑Instruct‑v0.1 使用 8 台 H100)。使用费用按 Enterprise Hub 组织的月度计费周期计收,可在 Hub 的计费设置中查看。

技术意义

  • 无服务器抽象 – 开发者无需再配置、扩展或维护 GPU 集群;推理通过简单的 HTTP 调用触发。
  • 标准化 API – 通过采用 OpenAI API 架构,现有工具和库可直接复用,无需更改代码。
  • 成本透明 – 按秒计费的 GPU 价格使预算更可预测,尤其是对突发性工作负载。
  • 性能优势 – 利用 NVIDIA DGX Cloud H100 GPU 以及即将推出的 TensorRT‑LLM 集成,可实现比通用云 GPU 更低的延迟和更高的吞吐量。

未来路线图

Hugging Face 宣布计划将 API 的功能扩展至 chat.completions.createmodels.list 之外,增加更多端点能力并扩大支持模型目录。即将把 NVIDIA TensorRT‑LLM 集成到 Hugging Face 的文本生成推理(TGI)框架中,预计将进一步提升推理速度,并将在后续发布基准测试和最佳实践指南。

停用通知

更新: 此服务已于 2025 年 4 月 10 日 停止并不可用。用户应采用更新的 Inference Providers 框架以继续获得无服务器推理功能。


上述信息反映了该服务在 2024 年 7 月 29 日宣布时的状态。随后停用意味着该服务已不再运行,但其架构概念仍对理解 Hugging Face 的无服务器 AI 推理方法具有参考价值。

Sources