Cohere 与 Hugging Face 推理提供商的集成
Hugging Face 已在 HF Hub 上将 Cohere 集成为受支持的推理提供商。此集成标志着模型创建者首次直接在 Hub 上共享并提供其模型,实现了面向企业的 AI 解决方案套件的无服务器推理。
支持的 Cohere 模型
- c4ai-command-a-03-2025:为需要快速、安全、高质量 AI 的高需求企业设计。它具备 256k 上下文长度、具可验证引用的高级检索增强生成(RAG)、代理工具使用以及对 23 种语言的多语言支持。
- aya-expanse-32b:一款最先进的多语言模型,支持 23 种语言(包括阿拉伯语、中文、法语、德语、印地语、日语、韩语和西班牙语),拥有 128k 上下文长度。
- c4ai-command-r7b-12-2024:一款开源权重模型,针对低成本和低延迟使用场景进行优化。它支持 23 种语言,并提供带引用验证的 RAG、推理以及代理工具使用,拥有 128k 上下文长度。
- aya-vision-32b:一款 320 亿参数的多模态模型,针对视觉语言任务(如 OCR、字幕生成、视觉推理和跨 23 种语言的问答)进行优化。
其他受支持的模型包括 c4ai-command-r-v01、c4ai-command-r-plus、c4ai-command-r-08-2024、aya-expanse-8b 和 aya-vision-8b。
实现与访问方式
用户可以通过 Hugging Face 网站 UI 或多种客户端 SDK 访问 Cohere 模型。
网站 UI
用户可以按 Cohere 推理提供商筛选模型中心,以查找兼容模型。在模型卡片中,用户可以选择提供商并直接在 UI 中运行推理。
客户端 SDK
可以使用以下方法调用 Cohere 模型:
- Python (huggingface_hub):通过安装
huggingface_hub(v0.30.0 或更高)并在InferenceClient中指定provider="cohere"。 - JavaScript (@huggingface/inference):使用
HfInference客户端,并在chatCompletion调用中指定provider: "cohere"参数。 - OpenAI 客户端:将
base_url设置为https://router.huggingface.co/cohere/compatibility/v1并使用 OpenAI 客户端库。
代理工具使用
Cohere 模型通过 Hugging Face Hub 客户端和 OpenAI 客户端支持最先进的代理工具使用。这使模型能够通过定义工具(函数)并将其传递给推理客户端,与外部 API 交互。
例如,可以定义一个工具来获取两个城市之间的航班信息。模型的聊天模板(开源)处理工具定义的表示,客户端将工具调用及其结果传回模型,以生成最终响应。
计费与额度
Hub 上的 Cohere 模型计费依据认证方式进行:
- 直接请求:使用 Cohere API 密钥的用户通过其 Cohere 账户直接计费。
- 路由请求:通过 Hub 进行认证的用户按标准 Cohere API 费率付费,Hugging Face 不收取额外加价。
此外,Hugging Face PRO 用户每月可获得价值 $2 的推理额度,可在不同提供商之间使用。