HUGS 출시: 무구성, 하드웨어 최적화 추론을 위한 오픈 LLM

TL;DR

Hugging Face는 HUGS (Hugging Face Generative AI Services) 를 발표했습니다. 이는 오픈소스 LLM을 위한 무구성, 하드웨어 최적화 추론 서비스로, NVIDIA, AMD에서 실행되며 곧 AWS Inferentia와 Google TPU에서도 지원됩니다. 기업이 모델을 사내에 배포하고 OpenAI 호환 API를 사용할 수 있게 합니다.


오픈 모델을 위한 무구성 최적화 추론

HUGS는 특정 GPU나 AI 가속기에 맞춘 추론 튜닝이라는 엔지니어링 부담을 없앱니다. 각 배포는 사전 테스트되고 대상 하드웨어에 자동으로 최적화되어, 수동 설정 없이 최대 처리량을 제공합니다. 이 서비스는 OpenAI 호환 API를 제공하므로 기존 애플리케이션은 엔드포인트 URL만 변경하면 HUGS로 전환할 수 있습니다.

왜 HUGS인가?

  • 사내 배포 – 모델이 조직 자체 인프라 내에서 실행되어 데이터와 지적 재산을 공용 인터넷에 노출하지 않습니다.
  • 무구성 – 배포 시간이 몇 주에서 몇 분으로 단축됩니다; HUGS는 NVIDIA, AMD 또는 기타 가속기에 대해 최적의 모델과 서빙 설정을 자동으로 선택합니다.
  • 하드웨어 최적화 – Hugging Face의 Text Generation Inference (TGI)를 기반으로 하여, HUGS는 지원되는 각 가속기에서 최고 성능을 끌어냅니다.
  • 하드웨어 유연성 – 현재 NVIDIA와 AMD GPU를 지원하며, AWS Inferentia와 Google TPU는 향후 출시 예정입니다.
  • 모델 유연성 – 다양한 오픈소스 LLM 카탈로그와 호환되어 개발자에게 선택의 자유를 제공합니다.
  • 표준 API – Kubernetes를 통해 배포하며 OpenAI API를 모방한 엔드포인트를 제공해 코드 변경을 최소화합니다.
  • 엔터프라이즈 배포 – 장기 지원, 엄격한 테스트, SOC2 준수, 번들 라이선스를 포함해 컴플라이언스 위험을 감소시킵니다.

"HUGS는 로컬에서 바로 사용할 수 있는 모델을 좋은 성능으로 배포하는 데 큰 시간 절약을 제공합니다 – HUGS 이전에는 일주일이 걸렸지만 이제는 1시간 이내에 완료할 수 있습니다. 주권 AI 요구사항을 가진 고객에게는 게임 체인저입니다!" – Henri Jouhaud, Polyconseil CTO

"우리는 GCP에서 L4 GPU를 사용해 Gemma 2를 배포하기 위해 HUGS를 시도했습니다 – 라이브러리, 버전, 파라미터를 손볼 필요 없이 바로 작동했습니다. HUGS 덕분에 오픈 모델의 내부 사용을 확장할 수 있다는 자신감을 얻었습니다!" – Ghislain Putois, Orange 연구 엔지니어

작동 방식

HUGS를 찾을 수 있는 곳

HUGS는 여러 배포 채널을 통해 얻을 수 있습니다:

  1. 클라우드 서비스 제공업체(CSP) 마켓플레이스 – AWS Marketplace와 Google Cloud Marketplace에서 배포 가능. Azure 지원은 가까운 시일 내에 발표될 예정입니다.
  2. DigitalOcean – GPU Droplets에서 1‑Click Models 서비스로 제공됩니다.
  3. Enterprise Hub – Enterprise Hub 구독이 있는 조직은 영업 요청을 통해 접근할 수 있습니다.

각 채널은 문서에 링크된 플랫폼별 배포 지침을 제공합니다.

가격

HUGS는 컨테이너 가동 시간에 기반한 온디맨드 가격 모델을 사용합니다:

  • AWS 및 GCP 마켓플레이스 – 컨테이너당 시간당 $1, 컴퓨팅 비용은 CSP에서 별도로 청구됩니다. AWS는 5일 무료 체험을 제공합니다.
  • DigitalOcean – 추가 HUGS 비용이 없으며, 기본 GPU Droplet 컴퓨팅 비용만 적용됩니다.
  • Enterprise Hub – 맞춤형 가격; 관심 있는 경우 Hugging Face 영업팀에 연락하십시오.

추론 실행

HUGS는 TGI를 활용하고 OpenAI 호환 Messages 엔드포인트를 제공합니다. 개발자는 curl, huggingface_hub SDK, openai Python SDK와 같은 표준 도구로 서비스를 호출할 수 있습니다. huggingface_hub 사용 예시:

from huggingface_hub import InferenceClient

ENDPOINT_URL = "REPLACE"  # your deployed URL or IP
client = InferenceClient(base_url=ENDPOINT_URL, api_key="-")

chat_completion = client.chat.completions.create(
    messages=[{"role": "user", "content": "What is Deep Learning?"}],
    temperature=0.7,
    top_p=0.95,
    max_tokens=128,
)

지원되는 모델 및 하드웨어

출시 시점에 HUGS는 Meta Llama‑3.1, NousResearch, Mistral, Google Gemma‑2, Qwen 계열 등 13개의 인기 오픈 LLM을 지원합니다. 서비스는 NVIDIA와 AMD GPU에서 실행되며, 향후 AWS Inferentia와 Google TPU 지원이 예정되어 있습니다. 자세한 호환성 매트릭스는 공식 Supported ModelsSupported Hardware 문서에 유지됩니다.

시작하기

기업은 AWS Marketplace, Google Cloud Marketplace, DigitalOcean 1‑Click Models 중 하나에서 배포하여 오늘 바로 HUGS를 시작할 수 있습니다. HUGS의 무구성 특성은 빠른 PoC 개발과 폐쇄형 API에서 자체 호스팅 오픈 모델로의 원활한 마이그레이션을 가능하게 합니다.


Note (September 2025 update): HUGS 모델 배포 컨테이너는 더 이상 제공되지 않습니다. 최적화된 Hugging Face 모델 배포를 위해서는 Dell Enterprise Hub와 Azure AI Foundry의 Hugging Face 컬렉션을 참고하십시오.

Sources