Featherless AI 与 Hugging Face 推理提供商的集成

Hugging Face 已在 Hugging Face Hub 上将 Featherless AI 集成为受支持的推理提供商。此集成使用户能够通过无服务器推理直接从模型页面以及通过客户端 SDK 访问各种开源文本和对话模型。

Featherless AI 能力

Featherless AI 是一种无服务器推理提供商,利用独特的模型加载和 GPU 编排,提供异常庞大的模型目录。它旨在弥合低成本访问有限模型集合与管理私有服务器以获取无限模型范围的高成本之间的差距,提供多种模型并采用无服务器计费方式。

支持的模型包括来自 DeepSeek、Meta、Google 和 Qwen 等提供商的最新开源发布。

集成与使用工作流

用户可以通过 Hugging Face 网站 UI 或官方客户端 SDK 与 Featherless AI 交互。

网站 UI 配置

在用户账户设置中,用户可以:

  • 管理 API 密钥:为特定提供商设置自定义 API 密钥。如果未提供自定义密钥,请求将通过 Hugging Face 路由。
  • 设置提供商偏好:按偏好顺序排列提供商,以决定它们在模型页面小部件和代码片段中的显示方式。

客户端 SDK 实现

Featherless AI 已集成到 Python 和 JavaScript SDK 中。要将 Featherless AI 用作提供商,必须将 provider 参数设置为 "featherless-ai"

Python 示例 (huggingface_hub v0.33.0+):

import os
from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="featherless-ai",
    api_key=os.environ["HF_TOKEN"]
)

messages = [
    {
        "role": "user",
        "content": "What is the capital of France?"
    }
]

completion = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-R1-0528", 
    messages=messages,
)

print(completion.choices[0].message)

JavaScript 示例 (@huggingface/inference):

import { InferenceClient } from "@huggingface/inference";

const client = new InferenceClient(process.env.HF_TOKEN);

const chatCompletion = await client.chatCompletion({
    model: "deepseek-ai/DeepSeek-R1-0528",
    messages: [
        {
            role: "user",
            content: "What is the capital of France?"
        }
    ],
    provider: "featherless-ai",
});

console.log(chatCompletion.choices[0].message);

请求路由与计费

在 Hugging Face Hub 上调用推理提供商有两种不同的模式:

  1. 自定义密钥(直接调用):请求使用用户自己的 API 密钥直接发送到推理提供商。在这种情况下,用户由提供商(例如 Featherless AI)直接计费。
  2. 由 HF 路由(路由请求):请求通过 Hugging Face Hub 进行身份验证。费用计入 Hugging Face 账户,Hugging Face 按标准 API 费率转嫁提供商成本,不收取额外加价。

订阅福利

  • PRO 用户:每月获得价值 $2 的推理积分,可在多个提供商之间使用。
  • 免费用户:可使用少量配额的免费推理。

Sources