Hugging Face 추론 솔루션 개요 2022년 11월
TL;DR
Hugging Face는 무료 위젯, 무료 API, 유료 Inference Endpoints, 그리고 Spaces 등 다양한 추론 서비스를 도입했습니다. 이를 통해 개발자는 최소한의 마찰과 비용 효율적인 확장성을 갖고 모델을 테스트, 프로토타입 제작 및 배포할 수 있습니다.
무료 추론 위젯: 즉시 모델 탐색
Inference Widget은 모든 모델 페이지에 존재하며, 사용자가 샘플 데이터를 업로드하고 클릭 한 번으로 코드를 작성하지 않고도 예측을 얻을 수 있게 합니다. 모델은 Hugging Face 서버에서 필요 시 로드되고 유휴 상태에서는 언로드되어 서비스가 무료로 유지됩니다. 이 위젯은 모델 동작, 출력 형식 및 샘플 성능을 빠르게 확인할 수 있게 해줍니다.
"모델이 무엇을 하는지, 출력이 어떤지, 데이터셋의 몇몇 샘플에 대해 어떻게 동작하는지 빠르게 파악할 수 있는 최고의 방법입니다. 모델은 필요할 때 우리 서버에 로드되고 더 이상 필요하지 않으면 언로드됩니다. 코드를 작성할 필요도 없고 기능도 무료입니다. 사랑하지 않을 이유가 있나요?" – Julien Simon
무료 추론 API: 개발을 위한 한 줄 HTTP 호출
Inference API는 위젯을 구동하고 간단한 HTTP 엔드포인트를 제공합니다. 모델 식별자, 입력 페이로드, Hub 토큰을 포함한 POST 요청을 보내면 몇 초 안에 예측을 받을 수 있습니다.
curl https://api-inference.huggingface.co/models/xlm-roberta-base \
-X POST \
-d '{"inputs": "The answer to the universe is <mask>."}' \
-H "Authorization: Bearer HF_TOKEN"
주요 특징:
- 맞춤형 서버나 컨테이너가 필요 없습니다.
- 빠른 비교를 위한 즉시 모델 교체.
- 무료 사용 티어, 속도 제한 적용.
- 속도 제한 및 SLA 보장이 없으므로 프로덕션 워크로드에는 권장되지 않습니다.
추론 엔드포인트를 통한 프로덕션: 보안, 확장성, 사용량 기반 요금
Inference Endpoints는 Hub 모델을 위한 관리형, 프로덕션 급 배포 레이어를 제공합니다. 사용자는 AWS 또는 Azure 지역을 선택하고 CPU 또는 GPU 인스턴스를 고른 뒤 자동 스케일링을 활성화할 수 있습니다. 가격은 시간당 $0.06부터 시작합니다.
보안 수준
| 수준 | 접근 | 일반 사용 |
|---|---|---|
| 공개 | 인터넷 전역 접근, 인증 없음 | 공개 데모, 오픈 API |
| 보호 | 유효한 Hugging Face 토큰 필요 | 제어된 공개 API |
| 비공개 | 격리된 서브넷, 프라이빗 클라우드 링크를 통해서만 접근 가능 | 엄격한 규정 준수, 내부 서비스 |
엔드포인트 UI는 상태, 스케일링 및 비용 메트릭을 표시해 비용‑성능 튜닝을 간소화합니다.
"Inference Endpoints를 사용하면 원하는 AWS 또는 Azure 지역에 보안적이고 확장 가능한 인프라 위에 모든 Hub 모델을 배포할 수 있습니다. 추가 설정으로 CPU·GPU 호스팅, 내장 자동 스케일링 등이 제공되어 적절한 비용/성능 비율을 쉽게 찾을 수 있습니다."
Spaces: 모델을 인터랙티브 앱으로 전환
Spaces는 모델 추론을 Gradio와 같은 프론트‑엔드 UI 프레임워크와 결합해 공유 가능한 데모나 경량 프로덕션 서비스를 만들 수 있게 합니다. 사용자는 UI에서 직접 Intel CPU 또는 NVIDIA GPU와 같은 고성능 하드웨어로 업그레이드할 수 있습니다.
핵심 포인트:
- 모델 상호작용을 위한 전체 웹 UI 제공.
- 성능을 위한 하드웨어 업그레이드 지원.
- 모델 시연이나 간단한 내부 도구 구축에 이상적.
시작하기: 탐색에서 배포까지
- Hugging Face Hub에 로그인하고 모델 카탈로그를 탐색합니다.
- 모델 페이지에서 추론 위젯을 사용해 즉시 예측을 테스트합니다.
- Deploy 버튼을 클릭해 무료 추론 API용 코드를 생성합니다.
- 프로덕션을 위해 동일한 배포 흐름에서 Inference Endpoints 또는 Spaces를 선택합니다.
- Hugging Face 포럼에 피드백을 제공합니다.
맥락 및 영향
이러한 서비스는 연구와 프로덕션 사이의 장벽을 낮추어 개발자가 최신 모델(Transformers, Diffusers 등)을 빠르게 반복하면서 Intel이 지원하는 CPU 추론을 통해 비용을 제어할 수 있게 합니다. 단계적 접근 방식(무료 위젯/API → 유료 엔드포인트/Spaces)은 개념 증명부터 기업 배포까지 일반적인 ML 프로젝트 라이프사이클에 맞춰져 있습니다.
자세한 내용은 공식 Hugging Face 블로그 게시물과 각 서비스에 대한 문서를 참고하세요.