Groq 与 Hugging Face 推理提供商的集成

Hugging Face 已在 Hugging Face Hub 上将 Groq 集成为受支持的推理提供商。此集成使开发者能够直接通过 Hub 的模型页面和客户端 SDK,利用 Groq 的语言处理单元(LPU)高速推理,支持包括 Meta 的 Llama 4 和 Qwen 的 QWQ-32B 在内的多种开源模型。

通过 Groq LPU 实现高性能推理

Groq 使用专门为计算密集型、具有顺序组件的应用(如大型语言模型(LLM))设计的语言处理单元(LPU)。通过克服传统 GPU 在推理方面的局限,LPU 架构提供显著更低的延迟和更高的吞吐量,优化了实时 AI 应用。

Groq 提供按需、按使用付费的 API 来访问这些公开可用的模型,现在已作为 Hugging Face Hub 上的推理提供商可供使用。

集成与工作流

用户可以通过两种主要接口访问 Groq 的推理能力:Hugging Face 网站 UI 和客户端 SDK。

网站 UI 配置

在用户账户设置中,用户可以管理其推理体验:

  • 设置 API 密钥:用户可以为特定提供商输入自己的 API 密钥。如果未提供自定义密钥,请求将通过 Hugging Face 路由。
  • 排序偏好:用户可以设置首选的提供商顺序,这决定了它们在模型页面小部件和代码片段中的显示顺序。

客户端 SDK 实现

Groq 已集成到 Hugging Face 的 Python 与 JavaScript 客户端 SDK 中。

对于 Python 用户,huggingface_hub 库(版本 v0.33.0 或源码安装)通过指定 provider="groq" 来使用 InferenceClient

对于 JavaScript 用户,@huggingface/inference 库通过在 chatCompletion 方法中传入 provider: "groq" 参数,实现相同功能。

路由与计费模型

在 Hub 上调用推理提供商有两种不同模式:

  1. 自定义密钥模式:请求使用用户自己的 API 密钥直接发送至推理提供商。在此模式下,用户直接由提供商(例如 Groq)计费。
  2. 由 HF 路由模式:请求通过 Hugging Face Hub 进行身份验证。在此模式下,用户无需提供商特定的令牌,费用计入 Hugging Face 账户。Hugging Face 直接转嫁提供商费用,不加任何加价。

订阅福利

  • PRO 用户:Hugging Face PRO 订阅者每月可获得价值 $2 的推理积分,可在不同提供商之间使用。
  • 免费用户:已登录的免费用户可获得少量免费推理配额。

Sources