Hugging Face 추론 솔루션 개요 2022년 11월

TL;DR

Hugging Face는 무료 위젯, 무료 API, 유료 Inference Endpoints, 그리고 Spaces 등 다양한 추론 서비스를 도입했습니다. 이를 통해 개발자는 최소한의 마찰과 비용 효율적인 확장성을 갖고 모델을 테스트, 프로토타입 제작 및 배포할 수 있습니다.


무료 추론 위젯: 즉시 모델 탐색

Inference Widget은 모든 모델 페이지에 존재하며, 사용자가 샘플 데이터를 업로드하고 클릭 한 번으로 코드를 작성하지 않고도 예측을 얻을 수 있게 합니다. 모델은 Hugging Face 서버에서 필요 시 로드되고 유휴 상태에서는 언로드되어 서비스가 무료로 유지됩니다. 이 위젯은 모델 동작, 출력 형식 및 샘플 성능을 빠르게 확인할 수 있게 해줍니다.

"모델이 무엇을 하는지, 출력이 어떤지, 데이터셋의 몇몇 샘플에 대해 어떻게 동작하는지 빠르게 파악할 수 있는 최고의 방법입니다. 모델은 필요할 때 우리 서버에 로드되고 더 이상 필요하지 않으면 언로드됩니다. 코드를 작성할 필요도 없고 기능도 무료입니다. 사랑하지 않을 이유가 있나요?" – Julien Simon

무료 추론 API: 개발을 위한 한 줄 HTTP 호출

Inference API는 위젯을 구동하고 간단한 HTTP 엔드포인트를 제공합니다. 모델 식별자, 입력 페이로드, Hub 토큰을 포함한 POST 요청을 보내면 몇 초 안에 예측을 받을 수 있습니다.

curl https://api-inference.huggingface.co/models/xlm-roberta-base \
    -X POST \
    -d '{"inputs": "The answer to the universe is <mask>."}' \
    -H "Authorization: Bearer HF_TOKEN"

주요 특징:

  • 맞춤형 서버나 컨테이너가 필요 없습니다.
  • 빠른 비교를 위한 즉시 모델 교체.
  • 무료 사용 티어, 속도 제한 적용.
  • 속도 제한 및 SLA 보장이 없으므로 프로덕션 워크로드에는 권장되지 않습니다.

추론 엔드포인트를 통한 프로덕션: 보안, 확장성, 사용량 기반 요금

Inference Endpoints는 Hub 모델을 위한 관리형, 프로덕션 급 배포 레이어를 제공합니다. 사용자는 AWS 또는 Azure 지역을 선택하고 CPU 또는 GPU 인스턴스를 고른 뒤 자동 스케일링을 활성화할 수 있습니다. 가격은 시간당 $0.06부터 시작합니다.

보안 수준

수준 접근 일반 사용
공개 인터넷 전역 접근, 인증 없음 공개 데모, 오픈 API
보호 유효한 Hugging Face 토큰 필요 제어된 공개 API
비공개 격리된 서브넷, 프라이빗 클라우드 링크를 통해서만 접근 가능 엄격한 규정 준수, 내부 서비스

엔드포인트 UI는 상태, 스케일링 및 비용 메트릭을 표시해 비용‑성능 튜닝을 간소화합니다.

"Inference Endpoints를 사용하면 원하는 AWS 또는 Azure 지역에 보안적이고 확장 가능한 인프라 위에 모든 Hub 모델을 배포할 수 있습니다. 추가 설정으로 CPU·GPU 호스팅, 내장 자동 스케일링 등이 제공되어 적절한 비용/성능 비율을 쉽게 찾을 수 있습니다."

Spaces: 모델을 인터랙티브 앱으로 전환

Spaces는 모델 추론을 Gradio와 같은 프론트‑엔드 UI 프레임워크와 결합해 공유 가능한 데모나 경량 프로덕션 서비스를 만들 수 있게 합니다. 사용자는 UI에서 직접 Intel CPU 또는 NVIDIA GPU와 같은 고성능 하드웨어로 업그레이드할 수 있습니다.

핵심 포인트:

  • 모델 상호작용을 위한 전체 웹 UI 제공.
  • 성능을 위한 하드웨어 업그레이드 지원.
  • 모델 시연이나 간단한 내부 도구 구축에 이상적.

시작하기: 탐색에서 배포까지

  1. Hugging Face Hub에 로그인하고 모델 카탈로그를 탐색합니다.
  2. 모델 페이지에서 추론 위젯을 사용해 즉시 예측을 테스트합니다.
  3. Deploy 버튼을 클릭해 무료 추론 API용 코드를 생성합니다.
  4. 프로덕션을 위해 동일한 배포 흐름에서 Inference Endpoints 또는 Spaces를 선택합니다.
  5. Hugging Face 포럼에 피드백을 제공합니다.

맥락 및 영향

이러한 서비스는 연구와 프로덕션 사이의 장벽을 낮추어 개발자가 최신 모델(Transformers, Diffusers 등)을 빠르게 반복하면서 Intel이 지원하는 CPU 추론을 통해 비용을 제어할 수 있게 합니다. 단계적 접근 방식(무료 위젯/API → 유료 엔드포인트/Spaces)은 개념 증명부터 기업 배포까지 일반적인 ML 프로젝트 라이프사이클에 맞춰져 있습니다.


자세한 내용은 공식 Hugging Face 블로그 게시물과 각 서비스에 대한 문서를 참고하세요.

Sources