Cohere 与 Hugging Face 推理提供商的集成

Hugging Face 已在 HF Hub 上将 Cohere 集成为受支持的推理提供商。此集成标志着模型创建者首次直接在 Hub 上共享并提供其模型,实现了面向企业的 AI 解决方案套件的无服务器推理。

支持的 Cohere 模型

  • c4ai-command-a-03-2025:为需要快速、安全、高质量 AI 的高需求企业设计。它具备 256k 上下文长度、具可验证引用的高级检索增强生成(RAG)、代理工具使用以及对 23 种语言的多语言支持。
  • aya-expanse-32b:一款最先进的多语言模型,支持 23 种语言(包括阿拉伯语、中文、法语、德语、印地语、日语、韩语和西班牙语),拥有 128k 上下文长度。
  • c4ai-command-r7b-12-2024:一款开源权重模型,针对低成本和低延迟使用场景进行优化。它支持 23 种语言,并提供带引用验证的 RAG、推理以及代理工具使用,拥有 128k 上下文长度。
  • aya-vision-32b:一款 320 亿参数的多模态模型,针对视觉语言任务(如 OCR、字幕生成、视觉推理和跨 23 种语言的问答)进行优化。

其他受支持的模型包括 c4ai-command-r-v01c4ai-command-r-plusc4ai-command-r-08-2024aya-expanse-8baya-vision-8b

实现与访问方式

用户可以通过 Hugging Face 网站 UI 或多种客户端 SDK 访问 Cohere 模型。

网站 UI

用户可以按 Cohere 推理提供商筛选模型中心,以查找兼容模型。在模型卡片中,用户可以选择提供商并直接在 UI 中运行推理。

客户端 SDK

可以使用以下方法调用 Cohere 模型:

  • Python (huggingface_hub):通过安装 huggingface_hub(v0.30.0 或更高)并在 InferenceClient 中指定 provider="cohere"
  • JavaScript (@huggingface/inference):使用 HfInference 客户端,并在 chatCompletion 调用中指定 provider: "cohere" 参数。
  • OpenAI 客户端:将 base_url 设置为 https://router.huggingface.co/cohere/compatibility/v1 并使用 OpenAI 客户端库。

代理工具使用

Cohere 模型通过 Hugging Face Hub 客户端和 OpenAI 客户端支持最先进的代理工具使用。这使模型能够通过定义工具(函数)并将其传递给推理客户端,与外部 API 交互。

例如,可以定义一个工具来获取两个城市之间的航班信息。模型的聊天模板(开源)处理工具定义的表示,客户端将工具调用及其结果传回模型,以生成最终响应。

计费与额度

Hub 上的 Cohere 模型计费依据认证方式进行:

  • 直接请求:使用 Cohere API 密钥的用户通过其 Cohere 账户直接计费。
  • 路由请求:通过 Hub 进行认证的用户按标准 Cohere API 费率付费,Hugging Face 不收取额外加价。

此外,Hugging Face PRO 用户每月可获得价值 $2 的推理额度,可在不同提供商之间使用。

Sources