Scaleway 成為 Hugging Face 推理提供者 – 功能、使用方式與計費

TL;DR

Scaleway 現已成為 Hugging Face Hub 的官方推理提供者,讓使用者能透過歐洲託管、低延遲的無伺服器 API,執行如 GPT‑OSS、Qwen3、DeepSeek R1 與 Gemma 3 等前沿模型。

為何此新增重要

加入 Scaleway 擴展了 Hugging Face 推理的地域與價格選項,提供低於 200 毫秒的首 token 延遲、每 token 起價 €0.20 M token 的計費方式,並可直接將請求路由至歐洲資料中心。這為歐洲開發者提供資料主權保證,並在 Hugging Face 路由計費與直接供應商計費之間提供更大的彈性。

支援的模型與存取點

  • 流行的開放權重模型可立即使用 inference_provider=scaleway 查詢參數取得,例如 openai/gpt-oss-120bQwen/Qwen3-Coder-30B-A3B-Instructdeepseek-ai/DeepSeek-R1-Distill-Llama-70Bgoogle/gemma-3-27b-it
  • Hub 上的 Scaleway 組織頁面(https://huggingface.co/scaleway)列出所有由該供應商託管的模型。
  • 可在 https://huggingface.co/models?inference_provider=scaleway&sort=trending 瀏覽受 Scaleway 支持的熱門模型。

運作方式

在 Hub UI 中

  1. API 金鑰管理 – 在使用者設定中,你可以儲存自訂的 Scaleway API 金鑰。若未設定金鑰,請求會自動透過 Hugging Face 路由,並由 HF 帳戶計費。
  2. 供應商偏好 – 你可以依偏好排序供應商;模型小工具與程式碼片段會遵循此排序。
  3. 模型頁面小工具 – 每個模型頁面會顯示相容的第三方供應商,並依你的偏好排序。

從客戶端 SDK

Python (huggingface_hub ≥ 0.34.6)

import os
from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="scaleway",
    api_key=os.environ["HF_TOKEN"],
)

messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]

completion = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=messages,
)
print(completion.choices[0].message)

你可以將 api_key 替換為原始的 Scaleway 金鑰,以繞過 HF 路由。

JavaScript (@huggingface/inference)

import { InferenceClient } from "@huggingface/inference";

const client = new InferenceClient(process.env.HF_TOKEN);

const chatCompletion = await client.chatCompletion({
  model: "openai/gpt-oss-120b",
  messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
  provider: "scaleway",
});

console.log(chatCompletion.choices[0].message);

兩段程式碼展示相同的 API 介面;唯一的差異在於 provider 欄位。

計費模式

  • 直接請求 – 當你提供 Scaleway API 金鑰時,計費由 Scaleway 在你的帳戶上處理。
  • 路由請求 – 當你使用 Hugging Face 令牌驗證時,Hub 會轉發請求,並以供應商的標準 API 費率收費,且不加收額外費用。
  • PRO 點數 – Hugging Face PRO 用戶每月可獲得 $2 的推理點數,可於任何供應商(包括 Scaleway)使用。
  • 免費層級 – 已登入的免費使用者可獲得有限的免費配額;升級至 PRO 後可解鎖更高的上限與 ZeroGPU 存取。

對開發者的影響

  • 資料主權 – 在巴黎資料中心託管推理符合歐盟中心的合規需求。
  • 效能 – 低於 200 毫秒的首 token 延遲,使 Scaleway 適用於互動式聊天機器人與代理管線。
  • 成本彈性 – 按 token 計費與可在直接與路由計費之間選擇的能力,讓團隊優化支出。
  • 多模態支援 – 服務支援結構化輸出、函式呼叫,以及文字與圖像生成,擴大使用案例的覆蓋範圍。

後續步驟與回饋

  • 前往 https://huggingface.co/docs/inference-providers/providers/scaleway 查看專屬文件,以進行進階設定。
  • 測試熱門模型清單,以評估你的工作負載的延遲與成本。
  • 透過 Hugging Face 討論空間提供回饋:https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49

本文總結了 2025‑09‑19 的官方 Hugging Face 公告。

Sources