Groq와 Hugging Face 추론 제공자 통합

Hugging Face는 Hugging Face Hub에서 지원되는 추론 제공자 중 하나로 Groq를 통합했습니다. 이 통합을 통해 개발자는 Meta의 Llama 4와 Qwen의 QWQ-32B 등 다양한 오픈소스 모델에 대해 Groq의 Language Processing Unit (LPU) 고속 추론을 Hub의 모델 페이지와 클라이언트 SDK를 통해 직접 활용할 수 있습니다.

Groq LPU를 통한 고성능 추론

Groq는 대규모 언어 모델(LLM)과 같은 순차적 구성 요소를 가진 계산 집약적인 애플리케이션을 위해 특별히 설계된 특수 Language Processing Unit (LPU)를 활용합니다. 기존 GPU의 추론 한계를 극복함으로써 LPU 아키텍처는 훨씬 낮은 지연 시간과 높은 처리량을 제공하여 실시간 AI 애플리케이션에 최적화됩니다.

Groq는 이러한 공개 모델에 접근하기 위한 온디맨드, 사용량 기반 요금제 API를 제공하며, 이제 Hugging Face Hub에서 추론 제공자로 이용할 수 있습니다.

통합 및 워크플로우

사용자는 두 가지 주요 인터페이스인 Hugging Face 웹사이트 UI와 클라이언트 SDK를 통해 Groq의 추론 기능에 접근할 수 있습니다.

웹사이트 UI 구성

사용자 계정 설정에서, 사용자는 다음과 같이 추론 환경을 관리할 수 있습니다:

  • API 키 설정: 사용자는 특정 제공자를 위해 자신의 API 키를 입력할 수 있습니다. 맞춤 키가 제공되지 않으면 요청은 Hugging Face를 통해 라우팅됩니다.
  • 우선순위 설정: 사용자는 제공자의 선호 순서를 지정할 수 있으며, 이는 모델 페이지 위젯 및 코드 스니펫에 표시되는 방식을 결정합니다.

클라이언트 SDK 구현

Groq는 Python 및 JavaScript용 Hugging Face 클라이언트 SDK에 통합되었습니다.

Python 사용자의 경우, huggingface_hub 라이브러리(버전 v0.33.0 또는 소스 설치)를 통해 provider="groq"를 지정하여 InferenceClient를 사용할 수 있습니다.

JavaScript 사용자의 경우, @huggingface/inference 라이브러리를 사용하여 chatCompletion 메서드 내에 provider: "groq" 매개변수를 전달함으로써 동일한 기능을 사용할 수 있습니다.

라우팅 및 청구 모델

Hub에서 추론 제공자를 호출하는 두 가지 구별되는 모드가 있습니다:

  1. 맞춤 키 모드: 사용자의 자체 API 키를 사용하여 요청이 직접 추론 제공자에게 전송됩니다. 이 모드에서는 사용자가 제공자(예: Groq)에게 직접 청구됩니다.
  2. HF 라우팅 모드: 요청이 Hugging Face Hub를 통해 인증됩니다. 이 모드에서는 사용자가 제공자 전용 토큰이 필요 없으며, 비용이 Hugging Face 계정에 청구됩니다. Hugging Face는 마진을 추가하지 않고 제공자 비용을 그대로 전달합니다.

구독 혜택

  • PRO 사용자: Hugging Face PRO 구독자는 매월 $2 상당의 추론 크레딧을 받으며, 이를 다양한 제공자에 사용할 수 있습니다.
  • 무료 사용자: 로그인한 무료 사용자는 소량의 무료 추론 할당량을 제공합니다.

Sources