Baseten과 Hugging Face Inference Provider 통합
Hugging Face는 Hugging Face Hub에서 지원되는 Inference Provider로 Baseten을 통합했습니다. 이 통합을 통해 개발자는 Hugging Face 웹사이트 UI와 클라이언트 SDK를 통해 Baseten의 서버리스 AI 인프라와 최첨단 모델 카탈로그에 직접 액세스할 수 있습니다.
서버리스 추론 기능
Baseten은 훈련 및 추론을 위한 서버리스 AI 인프라를 제공합니다. 이 통합을 통해 Baseten은 초기 단계로 Hugging Face Hub에서 대화형 및 텍스트 생성 작업을 지원합니다. 이를 통해 다음과 같은 여러 인기 있는 오픈 웨이트 대규모 언어 모델(LLM)에 즉시 액세스할 수 있습니다:
- DeepSeek V4 Flash
- Kimi K3
- GLM-5.2
텍스트 생성 이외의 추가적인 모델 유형 및 작업에 대한 지원은 향후 출시될 예정입니다.
통합 및 워크플로우
사용자는 Hugging Face 웹사이트 UI와 공식 클라이언트 SDK라는 두 가지 주요 인터페이스를 통해 Baseten이 호스팅하는 모델에 액세스할 수 있습니다.
웹사이트 UI 설정
사용자 계정 설정에서 Hugging Face 사용자는 추론 기본 설정을 관리할 수 있습니다:
- API Key Management: 사용자는 자신만의 Baseten API 키를 설정할 수 있습니다. 사용자 정의 키가 제공되지 않은 경우, 요청은 Hugging Face를 통해 라우팅됩니다.
- Provider Preference: 사용자는 선호도에 따라 제공업체를 정렬할 수 있으며, 이는 모델 페이지 위젯과 코드 스니펫에 표시되는 순서를 결정합니다.
클라이언트 SDK 및 에이전트 하네스
Baseten은 huggingface_hub Python 라이브러리(버전 1.26.1 이상) 및 @huggingface/inference JavaScript 라이브러리를 통해 사용할 수 있습니다.
Hugging Face Inference Provider는 Pi, OpenCode, Hermes Agents, OpenClaw와 같은 다양한 에이전트 하네스에 통합되어 있기 때문에, Baseten이 호스팅하는 모델은 추가적인 글루 코드(glue code) 없이 이러한 도구에 바로 연결할 수 있습니다.
라우팅 및 과금 모델
Baseten과 같은 Inference Provider를 호출하는 데는 두 가지 별개의 모드가 있습니다:
- Custom Key Mode: 사용자의 자체 제공업체 API 키를 사용하여 요청을 직접 Inference Provider로 보냅니다. 이 모드에서는 사용자가 Baseten으로부터 직접 비용을 청구받습니다.
- Routed by HF Mode: Hugging Face 토큰을 통해 인증을 거친 후 Baseten으로 라우팅됩니다. 이 모드에서는 Hugging Face의 추가 마진 없이 표준 제공업체 API 요율로 Hugging Face 계정에 비용이 청구됩니다.
PRO 사용자용 크레딧 시스템
Hugging Face PRO 사용자는 매달 2달러 상당의 Inference 크레딧을 받으며, 이는 다양한 제공업체를 통해 사용할 수 있습니다. 로그인한 무료 사용자의 경우에도 소량의 무료 추론 쿼터가 제공됩니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch