Cohere 與 Hugging Face 推理提供者的整合

Hugging Face 已在 HF Hub 上將 Cohere 整合為受支援的推理提供者。此整合標誌著模型創建者首次直接在 Hub 上分享與部署模型,實現無伺服器推理,提供完整的企業導向 AI 解決方案套件。

支援的 Cohere 模型

  • c4ai-command-a-03-2025:為高需求企業設計,提供快速、安全且高品質的 AI。具備 256k 上下文長度、先進的檢索增強生成(RAG)與可驗證引用、代理工具使用,以及支援 23 種語言的多語言功能。
  • aya-expanse-32b:最先進的多語言模型,支援 23 種語言(包括阿拉伯語、中文、法語、德語、印地語、日語、韓語與西班牙語),具備 128k 上下文長度。
  • c4ai-command-r7b-12-2024:開放權重模型,針對低成本與低延遲使用情境進行最佳化。支援 23 種語言,提供具引用驗證的 RAG、推理與代理工具使用,並具備 128k 上下文長度。
  • aya-vision-32b:具備 320 億參數的多模態模型,針對視覺語言任務(如 OCR、字幕生成、視覺推理與問答)進行最佳化,支援 23 種語言。

其他支援的模型包括 c4ai-command-r-v01c4ai-command-r-plusc4ai-command-r-08-2024aya-expanse-8baya-vision-8b

實作與存取方式

使用者可透過 Hugging Face 網站 UI 或多種客戶端 SDK 取得 Cohere 模型。

網站 UI

使用者可在模型中心依據 Cohere 推理提供者篩選,找到相容的模型。從模型卡片中,使用者可選擇提供者並直接在 UI 內執行推理。

客戶端 SDK

Cohere 模型可透過以下方式呼叫:

  • Python (huggingface_hub):安裝 huggingface_hub(v0.30.0 或更新版本),在 InferenceClient 中指定 provider="cohere"
  • JavaScript (@huggingface/inference):使用 HfInference 客戶端,於 chatCompletion 呼叫中設定 provider: "cohere" 參數。
  • OpenAI Client:將 base_url 設為 https://router.huggingface.co/cohere/compatibility/v1,並使用 OpenAI 客戶端函式庫。

代理工具使用

Cohere 模型支援最先進的代理工具使用,無論是透過 Hugging Face Hub 客戶端或 OpenAI 客戶端,都能讓模型透過定義工具(函式)並傳遞給推理客戶端,以與外部 API 互動。

例如,可定義一個工具來取得兩座城市之間的航班資訊。模型的聊天範本(開源)負責呈現工具定義,客戶端則將工具呼叫與結果回傳給模型,以產生最終回應。

計費與點數

Cohere 模型在 Hub 上的計費方式依據驗證方式而定:

  • Direct Requests:使用 Cohere API 金鑰的使用者,費用直接由其 Cohere 帳戶收取。
  • Routed Requests:透過 Hub 驗證的使用者,依照標準 Cohere API 費率計費,Hugging Face 不另加收費用。

此外,Hugging Face PRO 使用者每月可獲得價值 $2 的推理點數,可於不同提供者間使用。

Sources