Groq 与 Hugging Face 推理提供商的集成
Hugging Face 已在 Hugging Face Hub 上将 Groq 集成为受支持的推理提供商。此集成使开发者能够直接通过 Hub 的模型页面和客户端 SDK,利用 Groq 的语言处理单元(LPU)高速推理,支持包括 Meta 的 Llama 4 和 Qwen 的 QWQ-32B 在内的多种开源模型。
通过 Groq LPU 实现高性能推理
Groq 使用专门为计算密集型、具有顺序组件的应用(如大型语言模型(LLM))设计的语言处理单元(LPU)。通过克服传统 GPU 在推理方面的局限,LPU 架构提供显著更低的延迟和更高的吞吐量,优化了实时 AI 应用。
Groq 提供按需、按使用付费的 API 来访问这些公开可用的模型,现在已作为 Hugging Face Hub 上的推理提供商可供使用。
集成与工作流
用户可以通过两种主要接口访问 Groq 的推理能力:Hugging Face 网站 UI 和客户端 SDK。
网站 UI 配置
在用户账户设置中,用户可以管理其推理体验:
- 设置 API 密钥:用户可以为特定提供商输入自己的 API 密钥。如果未提供自定义密钥,请求将通过 Hugging Face 路由。
- 排序偏好:用户可以设置首选的提供商顺序,这决定了它们在模型页面小部件和代码片段中的显示顺序。
客户端 SDK 实现
Groq 已集成到 Hugging Face 的 Python 与 JavaScript 客户端 SDK 中。
对于 Python 用户,huggingface_hub 库(版本 v0.33.0 或源码安装)通过指定 provider="groq" 来使用 InferenceClient。
对于 JavaScript 用户,@huggingface/inference 库通过在 chatCompletion 方法中传入 provider: "groq" 参数,实现相同功能。
路由与计费模型
在 Hub 上调用推理提供商有两种不同模式:
- 自定义密钥模式:请求使用用户自己的 API 密钥直接发送至推理提供商。在此模式下,用户直接由提供商(例如 Groq)计费。
- 由 HF 路由模式:请求通过 Hugging Face Hub 进行身份验证。在此模式下,用户无需提供商特定的令牌,费用计入 Hugging Face 账户。Hugging Face 直接转嫁提供商费用,不加任何加价。
订阅福利
- PRO 用户:Hugging Face PRO 订阅者每月可获得价值 $2 的推理积分,可在不同提供商之间使用。
- 免费用户:已登录的免费用户可获得少量免费推理配额。