Scaleway 已加入 Hugging Face 推理提供商 – 功能、使用方式与计费
TL;DR
Scaleway 现已成为 Hugging Face Hub 的官方推理提供商,用户可通过无服务器 API 在欧洲托管的低延迟基础设施上运行前沿模型,如 GPT‑OSS、Qwen3、DeepSeek R1 与 Gemma 3。
为什么此新增重要
加入 Scaleway 为 Hugging Face 推理扩展了地域和定价选项,提供低于 200 毫秒的首 token 延迟,按 token 计费起价为 €0.20 每百万 token,并可直接通过欧洲数据中心路由请求。这为欧洲开发者提供了数据主权保障,并在 Hugging Face 路由计费与直接提供商计费之间提供了更大的灵活性。
支持的模型与访问点
- 常用的开源模型可立即使用
inference_provider=scaleway查询参数访问,例如openai/gpt-oss-120b、Qwen/Qwen3-Coder-30B-A3B-Instruct、deepseek-ai/DeepSeek-R1-Distill-Llama-70B与google/gemma-3-27b-it。 - Hub 上的 Scaleway 组织页面(
https://huggingface.co/scaleway)列出了该提供商托管的全部模型。 - 可在
https://huggingface.co/models?inference_provider=scaleway&sort=trending浏览受欢迎的 Scaleway 支持模型。
工作原理
在 Hub UI 中
- API 密钥管理 – 在用户设置中可以存储自定义的 Scaleway API 密钥。如果未设置密钥,请求会自动通过 Hugging Face 路由,费用计入您的 HF 账户。
- 提供商偏好 – 您可以按偏好排序提供商;模型小部件和代码片段会遵循此排序。
- 模型页面小部件 – 每个模型页面会显示兼容的第三方提供商,并按您的偏好排序。
从客户端 SDK
Python (huggingface_hub ≥ 0.34.6)
import os
from huggingface_hub import InferenceClient
client = InferenceClient(
provider="scaleway",
api_key=os.environ["HF_TOKEN"],
)
messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]
completion = client.chat.completions.create(
model="openai/gpt-oss-120b",
messages=messages,
)
print(completion.choices[0].message)
您可以将 api_key 替换为原始的 Scaleway 密钥,以绕过 HF 路由。
JavaScript (@huggingface/inference)
import { InferenceClient } from "@huggingface/inference";
const client = new InferenceClient(process.env.HF_TOKEN);
const chatCompletion = await client.chatCompletion({
model: "openai/gpt-oss-120b",
messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
provider: "scaleway",
});
console.log(chatCompletion.choices[0].message);
两个代码片段展示了相同的 API 表面;唯一的区别是 provider 字段。
计费模型
- 直接请求 – 当您提供 Scaleway API 密钥时,计费由 Scaleway 在您的账户上处理。
- 路由请求 – 当您使用 Hugging Face 令牌进行身份验证时,Hub 会转发请求,并按提供商的标准 API 费率收取费用,不会有额外加价。
- PRO 积分 – Hugging Face PRO 用户每月可获得价值 $2 的推理积分,可在任意提供商(包括 Scaleway)中使用。
- 免费层 – 已登录的免费用户拥有有限的免费配额;升级至 PRO 可解锁更高的配额和 ZeroGPU 访问。
对开发者的影响
- 数据主权 – 在巴黎数据中心托管推理满足欧盟中心的合规要求。
- 性能 – 低于 200 毫秒的首 token 延迟使 Scaleway 适用于交互式聊天机器人和代理流水线。
- 成本灵活性 – 按 token 计费以及可在直接计费和路由计费之间选择,让团队能够优化支出。
- 多模态支持 – 该服务支持结构化输出、函数调用以及文本和图像生成,扩展了使用场景覆盖范围。
后续步骤与反馈
- 查看
https://huggingface.co/docs/inference-providers/providers/scaleway上的专门文档,以获取高级配置。 - 测试热门模型列表,评估您的工作负载的延迟和成本。
- 通过 Hugging Face 讨论空间提供反馈:
https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49。
本文概述了官方 Hugging Face 于 2025‑09‑19 发布的公告。