Scaleway, Hugging Face 추론 제공자로 추가 – 기능, 사용법 및 요금제

TL;DR

Scaleway는 이제 Hugging Face Hub의 공식 추론 제공자가 되어, 사용자가 GPT‑OSS, Qwen3, DeepSeek R1 및 Gemma 3와 같은 최첨단 모델을 유럽에 호스팅된 저지연 서버리스 API를 통해 실행할 수 있습니다.

추가가 중요한 이유

Scaleway를 추가하면 Hugging Face 추론의 지리적 및 가격 옵션이 확대되어, 200 ms 미만의 첫 토큰 지연 시간, 토큰당 €0.20부터 시작하는 요금, 그리고 유럽 데이터 센터를 통한 직접 라우팅을 제공합니다. 이는 유럽 개발자에게 데이터 주권 보장을 제공하고, Hugging Face 라우팅 청구와 직접 제공자 청구 사이에서 선택할 수 있는 유연성을 높여줍니다.

지원되는 모델 및 접근 지점

  • 인기 있는 오픈‑웨이트 모델은 inference_provider=scaleway 쿼리 매개변수를 사용하면 즉시 이용 가능하며, 예를 들어 openai/gpt-oss-120b, Qwen/Qwen3-Coder-30B-A3B-Instruct, deepseek-ai/DeepSeek-R1-Distill-Llama-70B, google/gemma-3-27b-it 등이 있습니다.
  • Hub의 Scaleway 조직 페이지(https://huggingface.co/scaleway)에는 제공자가 호스팅하는 모든 모델이 나열되어 있습니다.
  • 인기 있는 Scaleway 기반 모델은 https://huggingface.co/models?inference_provider=scaleway&sort=trending에서 확인할 수 있습니다.

작동 방식

Hub UI에서

  1. API 키 관리 – 사용자 설정에서 맞춤형 Scaleway API 키를 저장할 수 있습니다. 키가 설정되지 않은 경우 요청은 자동으로 Hugging Face를 통해 라우팅되며, HF 계정에 청구됩니다.
  2. 제공자 선호도 – 제공자를 선호도 순으로 정렬할 수 있으며, 모델 위젯과 코드 스니펫이 이 순서를 따릅니다.
  3. 모델 페이지 위젯 – 각 모델 페이지에는 호환 가능한 타사 제공자가 표시되며, 사용자의 선호도에 따라 정렬됩니다.

클라이언트 SDK에서

Python (huggingface_hub ≥ 0.34.6)

import os
from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="scaleway",
    api_key=os.environ["HF_TOKEN"],
)

messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]

completion = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=messages,
)
print(completion.choices[0].message)

api_key를 원시 Scaleway 키로 교체하여 HF 라우팅을 우회할 수 있습니다.

JavaScript (@huggingface/inference)

import { InferenceClient } from "@huggingface/inference";

const client = new InferenceClient(process.env.HF_TOKEN);

const chatCompletion = await client.chatCompletion({
  model: "openai/gpt-oss-120b",
  messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
  provider: "scaleway",
});

console.log(chatCompletion.choices[0].message);

두 스니펫 모두 동일한 API 인터페이스를 보여주며, 유일한 차이점은 provider 필드입니다.

청구 모델

  • 직접 요청 – Scaleway API 키를 제공하면 청구는 귀하의 계정에 대한 Scaleway에서 처리됩니다.
  • 라우팅된 요청 – Hugging Face 토큰으로 인증하면 Hub가 요청을 전달하고, 추가 마크업 없이 제공자의 표준 API 요금을 청구합니다.
  • PRO 크레딧 – Hugging Face PRO 사용자는 매월 $2 상당의 추론 크레딧을 받으며, 이는 Scaleway를 포함한 모든 제공자에서 사용할 수 있습니다.
  • 무료 티어 – 로그인한 무료 사용자는 제한된 무료 할당량을 받으며, PRO로 업그레이드하면 더 높은 한도와 ZeroGPU 접근이 제공됩니다.

개발자에게 미치는 영향

  • 데이터 주권 – 파리 기반 데이터 센터에서 추론을 호스팅함으로써 EU 중심의 컴플라이언스 요구사항을 충족합니다.
  • 성능 – 200 ms 미만의 첫 토큰 지연 시간으로 Scaleway는 인터랙티브 챗봇 및 에이전트 파이프라인에 적합합니다.
  • 비용 유연성 – 토큰당 요금제와 직접 청구와 라우팅 청구 중 선택할 수 있는 기능을 통해 팀이 비용을 최적화할 수 있습니다.
  • 멀티모달 지원 – 이 서비스는 구조화된 출력, 함수 호출, 텍스트 및 이미지 생성 모두를 처리하여 사용 사례 범위를 확대합니다.

다음 단계 및 피드백

  • 고급 설정을 위해 https://huggingface.co/docs/inference-providers/providers/scaleway에 있는 전용 문서를 검토하세요.
  • 트렌딩 모델 목록을 테스트하여 워크로드에 대한 지연 시간과 비용을 평가하세요.
  • Hugging Face 토론 공간을 통해 피드백을 제공하세요: https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49.

이 게시물은 2025‑09‑19에 발표된 공식 Hugging Face 공지를 요약한 것입니다.

SUMMARY: Scaleway는 이제 Hugging Face Hub의 공식 추론 제공자로, 저지연·유럽 호스팅 서버리스 방식으로 최첨단 모델에 접근할 수 있으며, 유연한 청구 옵션을 제공합니다.

TITLE: Scaleway, Hugging Face 추론 제공자로 추가 – 기능, 사용법 및 요금제

Sources