Scaleway 已加入 Hugging Face 推理提供商 – 功能、使用方式与计费

TL;DR

Scaleway 现已成为 Hugging Face Hub 的官方推理提供商,用户可通过无服务器 API 在欧洲托管的低延迟基础设施上运行前沿模型,如 GPT‑OSS、Qwen3、DeepSeek R1 与 Gemma 3。

为什么此新增重要

加入 Scaleway 为 Hugging Face 推理扩展了地域和定价选项,提供低于 200 毫秒的首 token 延迟,按 token 计费起价为 €0.20 每百万 token,并可直接通过欧洲数据中心路由请求。这为欧洲开发者提供了数据主权保障,并在 Hugging Face 路由计费与直接提供商计费之间提供了更大的灵活性。

支持的模型与访问点

  • 常用的开源模型可立即使用 inference_provider=scaleway 查询参数访问,例如 openai/gpt-oss-120bQwen/Qwen3-Coder-30B-A3B-Instructdeepseek-ai/DeepSeek-R1-Distill-Llama-70Bgoogle/gemma-3-27b-it
  • Hub 上的 Scaleway 组织页面(https://huggingface.co/scaleway)列出了该提供商托管的全部模型。
  • 可在 https://huggingface.co/models?inference_provider=scaleway&sort=trending 浏览受欢迎的 Scaleway 支持模型。

工作原理

在 Hub UI 中

  1. API 密钥管理 – 在用户设置中可以存储自定义的 Scaleway API 密钥。如果未设置密钥,请求会自动通过 Hugging Face 路由,费用计入您的 HF 账户。
  2. 提供商偏好 – 您可以按偏好排序提供商;模型小部件和代码片段会遵循此排序。
  3. 模型页面小部件 – 每个模型页面会显示兼容的第三方提供商,并按您的偏好排序。

从客户端 SDK

Python (huggingface_hub ≥ 0.34.6)

import os
from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="scaleway",
    api_key=os.environ["HF_TOKEN"],
)

messages = [{"role": "user", "content": "Write a poem in the style of Shakespeare"}]

completion = client.chat.completions.create(
    model="openai/gpt-oss-120b",
    messages=messages,
)
print(completion.choices[0].message)

您可以将 api_key 替换为原始的 Scaleway 密钥,以绕过 HF 路由。

JavaScript (@huggingface/inference)

import { InferenceClient } from "@huggingface/inference";

const client = new InferenceClient(process.env.HF_TOKEN);

const chatCompletion = await client.chatCompletion({
  model: "openai/gpt-oss-120b",
  messages: [{ role: "user", content: "Write a poem in the style of Shakespeare" }],
  provider: "scaleway",
});

console.log(chatCompletion.choices[0].message);

两个代码片段展示了相同的 API 表面;唯一的区别是 provider 字段。

计费模型

  • 直接请求 – 当您提供 Scaleway API 密钥时,计费由 Scaleway 在您的账户上处理。
  • 路由请求 – 当您使用 Hugging Face 令牌进行身份验证时,Hub 会转发请求,并按提供商的标准 API 费率收取费用,不会有额外加价。
  • PRO 积分 – Hugging Face PRO 用户每月可获得价值 $2 的推理积分,可在任意提供商(包括 Scaleway)中使用。
  • 免费层 – 已登录的免费用户拥有有限的免费配额;升级至 PRO 可解锁更高的配额和 ZeroGPU 访问。

对开发者的影响

  • 数据主权 – 在巴黎数据中心托管推理满足欧盟中心的合规要求。
  • 性能 – 低于 200 毫秒的首 token 延迟使 Scaleway 适用于交互式聊天机器人和代理流水线。
  • 成本灵活性 – 按 token 计费以及可在直接计费和路由计费之间选择,让团队能够优化支出。
  • 多模态支持 – 该服务支持结构化输出、函数调用以及文本和图像生成,扩展了使用场景覆盖范围。

后续步骤与反馈

  • 查看 https://huggingface.co/docs/inference-providers/providers/scaleway 上的专门文档,以获取高级配置。
  • 测试热门模型列表,评估您的工作负载的延迟和成本。
  • 通过 Hugging Face 讨论空间提供反馈:https://huggingface.co/spaces/huggingface/HuggingDiscussions/discussions/49

本文概述了官方 Hugging Face 于 2025‑09‑19 发布的公告。

Sources