Hugging Face NVIDIA NIM API (serverless) 출시 및 폐지
TL;DR
Hugging Face는 NVIDIA NIM API (serverless) 를 Enterprise Hub 사용자에게 제공하여, OpenAI 호환 표준 API를 통해 NVIDIA DGX Cloud H100 GPU에서 오픈소스 LLM을 사용량 기반(pay‑as‑you‑go) 서버리스 추론을 할 수 있게 했습니다. 이 서비스는 고성능 생성 AI 접근성을 단순화하고, GPU 사용량을 초당 기준으로 청구합니다.
NVIDIA NIM API (serverless)란?
NVIDIA NIM API (serverless)는 새로운 Hugging Face Hub 서비스로, Enterprise Hub 조직이 Llama 3, Mistral 등 인기 있는 오픈소스 생성 모델을 NVIDIA DGX Cloud H100 Tensor Core GPU에서 인프라를 직접 관리하지 않고도 추론할 수 있게 합니다. 이 서비스는 Hugging Face와 NVIDIA 간 기존 협업을 기반으로 하며, 이전에 발표된 Train on DGX Cloud 제공을 보완합니다.
서비스 작동 방식
전제 조건
- Hugging Face Enterprise Hub 조직의 멤버십.
- 조직에 한정된 세분화된 액세스 토큰( Hugging Face Access Tokens 페이지에서 생성).
단계별 워크플로우
- 세분화된 토큰 생성 – “org permissions”만 포함된 토큰을 생성합니다; 추가 범위는 필요하지 않습니다.
- 지원되는 NIM 모델 찾기 – NVIDIA NIM Collection 또는 모델의 Hub 페이지를 탐색합니다. 예를 들어
meta-llama/Meta-Llama-3-8B-Instruct카드에는 Deploy 메뉴에 NVIDIA NIM API (serverless) 옵션이 있어 바로 사용할 수 있는 코드 스니펫을 제공합니다. - 추론 요청 전송 – OpenAI 호환 SDK(
openaiPython 패키지)를 사용하고, 기본 URLhttps://huggingface.co/api/integrations/dgx/v1와 세분화된 토큰을 API 키로 지정합니다. 현재 API는chat.completions.create와models.list엔드포인트를 지원합니다.
from openai import OpenAI
client = OpenAI(
base_url="https://huggingface.co/api/integrations/dgx/v1",
api_key="YOUR_FINE_GRAINED_TOKEN_HERE"
)
chat = client.chat.completions.create(
model="meta-llama/Meta-Llama-3-8B-Instruct",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Count to 500"}
],
stream=True,
max_tokens=1024
)
for chunk in chat:
print(chunk.choices[0].delta.content, end="")
models.list 엔드포인트를 사용하면 현재 이용 가능한 모든 NIM 모델을 열거할 수 있습니다.
지원 모델 및 가격
이 서비스는 NVIDIA H100 GPU 전용이며, 시간당 $8.25(≈ 초당 $0.0023)로 가격이 책정됩니다. 비용은 요청당 필요한 GPU 수와 요청 지연 시간에 따라 계산됩니다.
| 모델 ID | H100 GPU 수 | 일반 지연 시간* (입력 500, 출력 100) | 요청당 대략적인 비용 |
|---|---|---|---|
| meta-llama/Meta-Llama-3-8B-Instruct | 1 | 1 s | $0.0023 |
| meta-llama/Meta-Llama-3-70B-Instruct | 4 | 2 s | $0.0184 |
| meta-llama/Meta-Llama-3.1-405B-Instruct-FP8 | 8 | 5 s | $0.0917 |
*지연 시간은 DGX Cloud H100 하드웨어에서 측정되었습니다.
추가 지원 모델로는 다양한 Mixtral 및 Mistral 변형이 있으며, 각각 특정 GPU 수에 매핑됩니다(예: Mixtral‑8x22B‑Instruct‑v0.1은 8개의 H100 사용). 사용료는 Enterprise Hub 조직의 월 청구 주기에 따라 청구되며, Hub의 청구 설정에서 확인할 수 있습니다.
기술적 의의
- 서버리스 추상화 – 개발자는 GPU 클러스터를 프로비저닝, 스케일링 또는 유지관리할 필요 없이 간단한 HTTP 호출만으로 추론을 실행할 수 있습니다.
- 표준화된 API – OpenAI API 스키마를 채택함으로써 기존 도구와 라이브러리를 코드 변경 없이 재사용할 수 있습니다.
- 비용 투명성 – 초당 GPU 가격 책정으로 예산 관리가 예측 가능해지며, 특히 급증하는 워크로드에 유리합니다.
- 성능 우위 – NVIDIA DGX Cloud H100 GPU와 향후 TensorRT‑LLM 통합을 활용해 일반 클라우드 GPU 대비 낮은 지연 시간과 높은 처리량을 제공합니다.
향후 로드맵
Hugging Face는 chat.completions.create와 models.list를 넘어선 추가 엔드포인트 기능을 제공하고, 지원 모델 카탈로그를 확대할 계획을 발표했습니다. 또한 NVIDIA TensorRT‑LLM을 Hugging Face의 Text Generation Inference (TGI) 프레임워크에 통합하는 작업이 진행 중이며, 이는 추론 속도를 더욱 높이고 벤치마크 및 모범 사례 가이드를 곧 공개할 예정입니다.
폐지 안내
업데이트: 이 서비스는 2025년 4월 10일에 폐지되어 이용할 수 없게 되었습니다. 사용자는 지속적인 서버리스 추론 기능을 위해 새로운 Inference Providers 프레임워크로 전환하도록 권장됩니다.
위 정보는 2024년 7월 29일 발표된 서비스 상태를 반영합니다. 이후 폐지로 인해 서비스는 더 이상 운영되지 않지만, 아키텍처 개념은 Hugging Face의 서버리스 AI 추론 접근 방식을 이해하는 데 여전히 유용합니다.