HUGS 출시: 무구성, 하드웨어 최적화 추론을 위한 오픈 LLM
TL;DR
Hugging Face는 HUGS (Hugging Face Generative AI Services) 를 발표했습니다. 이는 오픈소스 LLM을 위한 무구성, 하드웨어 최적화 추론 서비스로, NVIDIA, AMD에서 실행되며 곧 AWS Inferentia와 Google TPU에서도 지원됩니다. 기업이 모델을 사내에 배포하고 OpenAI 호환 API를 사용할 수 있게 합니다.
오픈 모델을 위한 무구성 최적화 추론
HUGS는 특정 GPU나 AI 가속기에 맞춘 추론 튜닝이라는 엔지니어링 부담을 없앱니다. 각 배포는 사전 테스트되고 대상 하드웨어에 자동으로 최적화되어, 수동 설정 없이 최대 처리량을 제공합니다. 이 서비스는 OpenAI 호환 API를 제공하므로 기존 애플리케이션은 엔드포인트 URL만 변경하면 HUGS로 전환할 수 있습니다.
왜 HUGS인가?
- 사내 배포 – 모델이 조직 자체 인프라 내에서 실행되어 데이터와 지적 재산을 공용 인터넷에 노출하지 않습니다.
- 무구성 – 배포 시간이 몇 주에서 몇 분으로 단축됩니다; HUGS는 NVIDIA, AMD 또는 기타 가속기에 대해 최적의 모델과 서빙 설정을 자동으로 선택합니다.
- 하드웨어 최적화 – Hugging Face의 Text Generation Inference (TGI)를 기반으로 하여, HUGS는 지원되는 각 가속기에서 최고 성능을 끌어냅니다.
- 하드웨어 유연성 – 현재 NVIDIA와 AMD GPU를 지원하며, AWS Inferentia와 Google TPU는 향후 출시 예정입니다.
- 모델 유연성 – 다양한 오픈소스 LLM 카탈로그와 호환되어 개발자에게 선택의 자유를 제공합니다.
- 표준 API – Kubernetes를 통해 배포하며 OpenAI API를 모방한 엔드포인트를 제공해 코드 변경을 최소화합니다.
- 엔터프라이즈 배포 – 장기 지원, 엄격한 테스트, SOC2 준수, 번들 라이선스를 포함해 컴플라이언스 위험을 감소시킵니다.
"HUGS는 로컬에서 바로 사용할 수 있는 모델을 좋은 성능으로 배포하는 데 큰 시간 절약을 제공합니다 – HUGS 이전에는 일주일이 걸렸지만 이제는 1시간 이내에 완료할 수 있습니다. 주권 AI 요구사항을 가진 고객에게는 게임 체인저입니다!" – Henri Jouhaud, Polyconseil CTO
"우리는 GCP에서 L4 GPU를 사용해 Gemma 2를 배포하기 위해 HUGS를 시도했습니다 – 라이브러리, 버전, 파라미터를 손볼 필요 없이 바로 작동했습니다. HUGS 덕분에 오픈 모델의 내부 사용을 확장할 수 있다는 자신감을 얻었습니다!" – Ghislain Putois, Orange 연구 엔지니어
작동 방식
HUGS를 찾을 수 있는 곳
HUGS는 여러 배포 채널을 통해 얻을 수 있습니다:
- 클라우드 서비스 제공업체(CSP) 마켓플레이스 – AWS Marketplace와 Google Cloud Marketplace에서 배포 가능. Azure 지원은 가까운 시일 내에 발표될 예정입니다.
- DigitalOcean – GPU Droplets에서 1‑Click Models 서비스로 제공됩니다.
- Enterprise Hub – Enterprise Hub 구독이 있는 조직은 영업 요청을 통해 접근할 수 있습니다.
각 채널은 문서에 링크된 플랫폼별 배포 지침을 제공합니다.
가격
HUGS는 컨테이너 가동 시간에 기반한 온디맨드 가격 모델을 사용합니다:
- AWS 및 GCP 마켓플레이스 – 컨테이너당 시간당 $1, 컴퓨팅 비용은 CSP에서 별도로 청구됩니다. AWS는 5일 무료 체험을 제공합니다.
- DigitalOcean – 추가 HUGS 비용이 없으며, 기본 GPU Droplet 컴퓨팅 비용만 적용됩니다.
- Enterprise Hub – 맞춤형 가격; 관심 있는 경우 Hugging Face 영업팀에 연락하십시오.
추론 실행
HUGS는 TGI를 활용하고 OpenAI 호환 Messages 엔드포인트를 제공합니다. 개발자는 curl, huggingface_hub SDK, openai Python SDK와 같은 표준 도구로 서비스를 호출할 수 있습니다. huggingface_hub 사용 예시:
from huggingface_hub import InferenceClient
ENDPOINT_URL = "REPLACE" # your deployed URL or IP
client = InferenceClient(base_url=ENDPOINT_URL, api_key="-")
chat_completion = client.chat.completions.create(
messages=[{"role": "user", "content": "What is Deep Learning?"}],
temperature=0.7,
top_p=0.95,
max_tokens=128,
)
지원되는 모델 및 하드웨어
출시 시점에 HUGS는 Meta Llama‑3.1, NousResearch, Mistral, Google Gemma‑2, Qwen 계열 등 13개의 인기 오픈 LLM을 지원합니다. 서비스는 NVIDIA와 AMD GPU에서 실행되며, 향후 AWS Inferentia와 Google TPU 지원이 예정되어 있습니다. 자세한 호환성 매트릭스는 공식 Supported Models 및 Supported Hardware 문서에 유지됩니다.
시작하기
기업은 AWS Marketplace, Google Cloud Marketplace, DigitalOcean 1‑Click Models 중 하나에서 배포하여 오늘 바로 HUGS를 시작할 수 있습니다. HUGS의 무구성 특성은 빠른 PoC 개발과 폐쇄형 API에서 자체 호스팅 오픈 모델로의 원활한 마이그레이션을 가능하게 합니다.
Note (September 2025 update): HUGS 모델 배포 컨테이너는 더 이상 제공되지 않습니다. 최적화된 Hugging Face 모델 배포를 위해서는 Dell Enterprise Hub와 Azure AI Foundry의 Hugging Face 컬렉션을 참고하십시오.