Scaleway 成為 Hugging Face 推理提供者 – 功能、使用方式與計費
TL;DR
Scaleway 現已成為 Hugging Face Hub 的官方推理提供者,讓使用者能透過歐洲託管、低延遲的無伺服器 API,執行如 GPT‑OSS、Qwen3、DeepSeek R1 與 Gemma 3 等前沿模型。
為何此新增重要
加入 Scaleway 擴展了 Hugging Face 推理的地域與價格選項,提供低於 200 毫秒的首 token 延遲、每 token 起價 €0.20 M token 的計費方式,並可直接將請求路由至歐洲資料中心。這為歐洲開發者提供資料主權保證,並在 Hugging Face 路由計費與直接供應商計費之間提供更大的彈性。
支援的模型與存取點
- 流行的開放權重模型可立即使用
inference_provider=scaleway查詢參數取得,例如openai/gpt-oss-120b、Qwen/Qwen3-Coder-30B-A3B-Instruct、deepseek-ai/DeepSeek-R1-Distill-Llama-70B與google/gemma-3-27b-it。 - Hub 上的 Scaleway 組織頁面(
https://huggingface.co/scaleway)列出所有由該供應商託管的模型。 - 可在
https://huggingface.co/models?inference_provider=scaleway&sort=trending瀏覽受 Scaleway 支持的熱門模型。
運作方式
在 Hub UI 中
- API 金鑰管理 – 在使用者設定中,你可以儲存自訂的 Scaleway API 金鑰。若未設定金鑰,請求會自動透過 Hugging Face 路由,並由 HF 帳戶計費。
- 供應商偏好 – 你可以依偏好排序供應商;模型小工具與程式碼片段會遵循此排序。
- 模型頁面小工具 – 每個模型頁面會顯示相容的第三方供應商,並依你的偏好排序。
從客戶端 SDK
Python (huggingface_hub ≥ 0.34.6)
import os
from huggingface_hub import InferenceClient
client = InferenceClient(
provider="scaleway",
api_key=os.environ["HF_TOKEN"],
)
messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]
completion = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=messages,
)
print(completion.choices[0].message)
你可以將 api_key 替換為原始的 Scaleway 金鑰,以繞過 HF 路由。
JavaScript (@huggingface/inference)
import { InferenceClient } from "@huggingface/inference";
const client = new InferenceClient(process.env.HF_TOKEN);
const chatCompletion = await client.chatCompletion({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
provider: "scaleway",
});
console.log(chatCompletion.choices[0].message);
兩段程式碼展示相同的 API 介面;唯一的差異在於 provider 欄位。
計費模式
- 直接請求 – 當你提供 Scaleway API 金鑰時,計費由 Scaleway 在你的帳戶上處理。
- 路由請求 – 當你使用 Hugging Face 令牌驗證時,Hub 會轉發請求,並以供應商的標準 API 費率收費,且不加收額外費用。
- PRO 點數 – Hugging Face PRO 用戶每月可獲得 $2 的推理點數,可於任何供應商(包括 Scaleway)使用。
- 免費層級 – 已登入的免費使用者可獲得有限的免費配額;升級至 PRO 後可解鎖更高的上限與 ZeroGPU 存取。
對開發者的影響
- 資料主權 – 在巴黎資料中心託管推理符合歐盟中心的合規需求。
- 效能 – 低於 200 毫秒的首 token 延遲,使 Scaleway 適用於互動式聊天機器人與代理管線。
- 成本彈性 – 按 token 計費與可在直接與路由計費之間選擇的能力,讓團隊優化支出。
- 多模態支援 – 服務支援結構化輸出、函式呼叫,以及文字與圖像生成,擴大使用案例的覆蓋範圍。
後續步驟與回饋
- 前往
https://huggingface.co/docs/inference-providers/providers/scaleway查看專屬文件,以進行進階設定。 - 測試熱門模型清單,以評估你的工作負載的延遲與成本。
- 透過 Hugging Face 討論空間提供回饋:
https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49。
本文總結了 2025‑09‑19 的官方 Hugging Face 公告。