Scaleway, Hugging Face 추론 제공자로 추가 – 기능, 사용법 및 요금제
TL;DR
Scaleway는 이제 Hugging Face Hub의 공식 추론 제공자가 되어, 사용자가 GPT‑OSS, Qwen3, DeepSeek R1 및 Gemma 3와 같은 최첨단 모델을 유럽에 호스팅된 저지연 서버리스 API를 통해 실행할 수 있습니다.
추가가 중요한 이유
Scaleway를 추가하면 Hugging Face 추론의 지리적 및 가격 옵션이 확대되어, 200 ms 미만의 첫 토큰 지연 시간, 토큰당 €0.20부터 시작하는 요금, 그리고 유럽 데이터 센터를 통한 직접 라우팅을 제공합니다. 이는 유럽 개발자에게 데이터 주권 보장을 제공하고, Hugging Face 라우팅 청구와 직접 제공자 청구 사이에서 선택할 수 있는 유연성을 높여줍니다.
지원되는 모델 및 접근 지점
- 인기 있는 오픈‑웨이트 모델은
inference_provider=scaleway쿼리 매개변수를 사용하면 즉시 이용 가능하며, 예를 들어openai/gpt-oss-120b,Qwen/Qwen3-Coder-30B-A3B-Instruct,deepseek-ai/DeepSeek-R1-Distill-Llama-70B,google/gemma-3-27b-it등이 있습니다. - Hub의 Scaleway 조직 페이지(
https://huggingface.co/scaleway)에는 제공자가 호스팅하는 모든 모델이 나열되어 있습니다. - 인기 있는 Scaleway 기반 모델은
https://huggingface.co/models?inference_provider=scaleway&sort=trending에서 확인할 수 있습니다.
작동 방식
Hub UI에서
- API 키 관리 – 사용자 설정에서 맞춤형 Scaleway API 키를 저장할 수 있습니다. 키가 설정되지 않은 경우 요청은 자동으로 Hugging Face를 통해 라우팅되며, HF 계정에 청구됩니다.
- 제공자 선호도 – 제공자를 선호도 순으로 정렬할 수 있으며, 모델 위젯과 코드 스니펫이 이 순서를 따릅니다.
- 모델 페이지 위젯 – 각 모델 페이지에는 호환 가능한 타사 제공자가 표시되며, 사용자의 선호도에 따라 정렬됩니다.
클라이언트 SDK에서
Python (huggingface_hub ≥ 0.34.6)
import os
from huggingface_hub import InferenceClient
client = InferenceClient(
provider="scaleway",
api_key=os.environ["HF_TOKEN"],
)
messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]
completion = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=messages,
)
print(completion.choices[0].message)
api_key를 원시 Scaleway 키로 교체하여 HF 라우팅을 우회할 수 있습니다.
JavaScript (@huggingface/inference)
import { InferenceClient } from "@huggingface/inference";
const client = new InferenceClient(process.env.HF_TOKEN);
const chatCompletion = await client.chatCompletion({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
provider: "scaleway",
});
console.log(chatCompletion.choices[0].message);
두 스니펫 모두 동일한 API 인터페이스를 보여주며, 유일한 차이점은 provider 필드입니다.
청구 모델
- 직접 요청 – Scaleway API 키를 제공하면 청구는 귀하의 계정에 대한 Scaleway에서 처리됩니다.
- 라우팅된 요청 – Hugging Face 토큰으로 인증하면 Hub가 요청을 전달하고, 추가 마크업 없이 제공자의 표준 API 요금을 청구합니다.
- PRO 크레딧 – Hugging Face PRO 사용자는 매월 $2 상당의 추론 크레딧을 받으며, 이는 Scaleway를 포함한 모든 제공자에서 사용할 수 있습니다.
- 무료 티어 – 로그인한 무료 사용자는 제한된 무료 할당량을 받으며, PRO로 업그레이드하면 더 높은 한도와 ZeroGPU 접근이 제공됩니다.
개발자에게 미치는 영향
- 데이터 주권 – 파리 기반 데이터 센터에서 추론을 호스팅함으로써 EU 중심의 컴플라이언스 요구사항을 충족합니다.
- 성능 – 200 ms 미만의 첫 토큰 지연 시간으로 Scaleway는 인터랙티브 챗봇 및 에이전트 파이프라인에 적합합니다.
- 비용 유연성 – 토큰당 요금제와 직접 청구와 라우팅 청구 중 선택할 수 있는 기능을 통해 팀이 비용을 최적화할 수 있습니다.
- 멀티모달 지원 – 이 서비스는 구조화된 출력, 함수 호출, 텍스트 및 이미지 생성 모두를 처리하여 사용 사례 범위를 확대합니다.
다음 단계 및 피드백
- 고급 설정을 위해
https://huggingface.co/docs/inference-providers/providers/scaleway에 있는 전용 문서를 검토하세요. - 트렌딩 모델 목록을 테스트하여 워크로드에 대한 지연 시간과 비용을 평가하세요.
- Hugging Face 토론 공간을 통해 피드백을 제공하세요:
https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49.
이 게시물은 2025‑09‑19에 발표된 공식 Hugging Face 공지를 요약한 것입니다.
SUMMARY: Scaleway는 이제 Hugging Face Hub의 공식 추론 제공자로, 저지연·유럽 호스팅 서버리스 방식으로 최첨단 모델에 접근할 수 있으며, 유연한 청구 옵션을 제공합니다.
TITLE: Scaleway, Hugging Face 추론 제공자로 추가 – 기능, 사용법 및 요금제