Hugging Face 인퍼런스 프로바이더 통합

허깅 페이스는 fal, Replicate, SambaNova, 그리고 Together AI 네 가지 서버리스 인퍼런스 프로바이더를 허브의 모델 페이지와 클라이언트 SDK에 직접 통합했습니다. 이 조치는 허브가 자체 서버리스 인퍼런스 API를 호스팅하는 것에서 다양한 전문 서버리스 프로바이더 생태계에 대한 통합 접근을 제공하도록 전환합니다.

통합 서버리스 인퍼런스 접근

사용자는 이제 허브에서 직접 다양한 모델에 대한 서버리스 인퍼런스에 접근할 수 있습니다. 이 통합은 별도의 인프라를 관리하지 않고도 DeepSeek-R1 및 FLUX.1-dev와 같은 모델의 탐색과 프로토타이핑을 더 쉽게 해줍니다.

웹사이트 UI 통합

허브의 사용자 계정 설정에서 사용자는 두 가지 주요 방법을 통해 인퍼런스 경험을 관리할 수 있습니다:

  • Custom API Keys: 사용자는 특정 프로바이더에 대한 자신의 API 키를 설정할 수 있습니다. 이러한 키를 사용하는 요청은 해당 프로바이더로 직접 전송됩니다.
  • Provider Preference: 사용자는 선호도에 따라 프로바이더 순서를 정할 수 있으며, 이는 모델 페이지 위젯과 코드 스니펫에서 어떻게 표시되는지를 결정합니다.

라우팅 모드

이 시스템을 통해 Inference API를 호출하는 데는 두 가지 서로 다른 모드가 있습니다:

  1. Custom Key Mode: 사용자의 해당 프로바이더용 자체 API 키를 사용하여 인퍼런스 프로바이더로 직접 호출이 전송됩니다.
  2. Routed by HF: 요청은 허깅 페이스를 통해 라우팅됩니다. 이 모드에서는 사용자는 프로바이더별 토큰이 필요하지 않으며, 비용은 허깅 페이스 계정에 직접 적용됩니다.

기술 구현 및 SDK

Python Integration

Using the huggingface_hub library (v0.28.0 or later), developers can specify a provider in the InferenceClient:

from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="together",
    api_key="xxxxxxxxxxxxxxxxxxxxxxxx"
)

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-R1", 
    messages=[{"role": "user", "content": "What is the capital of France?"}], 
    max_tokens=500
)

JavaScript Integration

Developers using @huggingface/inference can pass the provider argument within the chatCompletion method:

import { HfInference } from "@huggingface/inference\);\n\nconst client = new HfInference("xxxxxxxxxxxxxxxxxxxxxxxx");\n\nconst chatCompletion = await client.chatCompletion({\n    model: "deepseek-ai/DeepSeek-R1",\n    provider: "together",\n    max_tokens: 500\n});

HTTP Routing Proxy

Hugging Face exposes a routing proxy under the huggingface.co domain, enabling OpenAI-compatible API calls via the URL structure: https://router.huggingface.co/{provider}.

Billing and Credits

Billing depends on the chosen routing mode:

  • Direct Requests: 사용자는 자신의 프로바이더 계정을 사용하여 인퍼런스 프로바이더로부터 직접 청구됩니다.
  • Routed Requests: 사용자는 허깅 페이스를 통해 전달되는 표준 프로바이더 API 요금을 지불하며, 추가 마크업은 없습니다.

Hugging Face PRO 사용자는 매달 제공업체 전반에 걸쳐 사용할 수 있는 $2 상당의 인퍼런스 크레딧을 받습니다. 로그인한 무료 사용자는 소량의 무료 인퍼런스 할당량을 제공받습니다.

Community Feedback and Perspectives

Community discussion on the announcement has highlighted several points of contention and technical hurdles:

"이전 프로는 20,000 요청을 제공했습니다. 이제 사라졌습니다. 아쉽네요."\n> "이것은 나쁜 결정이라고 생각합니다. 저는 $9를 지불했지만 단지 $2만 사용했습니다. auparavant에는 일일 20k 제한이 있었습니다."\n\n사용자는 최신 라이브러리 버전으로 업데이트되지 않은 경우 InferenceClient.__init__()에서 예상치 못한 키워드 인수를 받는 문제뿐만 아니라, 사용자를 대신하여 Inference Providers를 호출할 때 권한과 관련된 403 Forbidden 오류도 보고했습니다.

Sources