Cohere와 Hugging Face 추론 제공자 통합

Hugging Face는 Cohere를 HF Hub에서 지원되는 추론 제공자 중 하나로 통합했습니다. 이번 통합은 모델 제작자가 자신의 모델을 Hub에 직접 공유하고 서비스하는 첫 사례로, 기업 중심 AI 솔루션을 위한 포괄적인 서버리스 추론을 가능하게 합니다.

지원되는 Cohere 모델

Cohere와 Cohere Labs는 특정 비즈니스 및 연구 용도에 최적화된 여러 모델을 제공하며, 이제 서버리스 추론을 통해 이용할 수 있습니다:

  • c4ai-command-a-03-2025: 빠르고 안전하며 고품질 AI가 필요한 대규모 기업을 위해 설계되었습니다. 256k 컨텍스트 길이, 검증 가능한 인용이 포함된 고급 검색 보강 생성(RAG), 에이전트형 도구 사용, 23개 언어에 대한 다국어 지원을 특징으로 합니다.
  • aya-expanse-32b: 23개 언어(아랍어, 중국어, 프랑스어, 독일어, 힌디어, 일본어, 한국어, 스페인어 등)를 지원하는 최첨단 다국어 모델이며, 128k 컨텍스트 길이를 제공합니다.
  • c4ai-command-r7b-12-2024: 저비용·저지연 사용 사례에 최적화된 오픈 웨이트 모델입니다. 23개 언어를 지원하고, 검증된 인용이 포함된 RAG, 추론, 에이전트형 도구 사용을 128k 컨텍스트 길이와 함께 제공합니다.
  • aya-vision-32b: 32억 파라미터를 가진 멀티모달 모델로, OCR, 캡션 생성, 시각적 추론, 질문 응답 등 비전‑언어 작업에 최적화되어 있으며 23개 언어를 지원합니다.

그 외 지원되는 모델에는 c4ai-command-r-v01, c4ai-command-r-plus, c4ai-command-r-08-2024, aya-expanse-8b, aya-vision-8b 등이 있습니다.

구현 및 접근 방법

사용자는 Hugging Face 웹사이트 UI 또는 여러 클라이언트 SDK를 통해 Cohere 모델에 접근할 수 있습니다.

웹사이트 UI

모델 허브에서 Cohere 추론 제공자를 필터링하여 호환 모델을 찾을 수 있습니다. 모델 카드에서 제공자를 선택하고 UI 내에서 직접 추론을 실행할 수 있습니다.

클라이언트 SDK

다음 방법으로 Cohere 모델을 호출할 수 있습니다:

  • Python (huggingface_hub): huggingface_hub(v0.30.0 이상)를 설치하고 InferenceClientprovider="cohere"를 지정합니다.
  • JavaScript (@huggingface/inference): HfInference 클라이언트를 사용하고 chatCompletion 호출 시 provider: "cohere" 매개변수를 지정합니다.
  • OpenAI Client: base_urlhttps://router.huggingface.co/cohere/compatibility/v1 로 설정하고 OpenAI 클라이언트 라이브러리를 사용합니다.

에이전트형 도구 사용

Cohere 모델은 Hugging Face Hub 클라이언트와 OpenAI 클라이언트 모두에서 최첨단 에이전트형 도구 사용을 지원합니다. 이를 통해 모델이 외부 API와 상호 작용하도록 도구(함수)를 정의하고 추론 클라이언트에 전달할 수 있습니다.

예를 들어, 두 도시 간 항공편 정보를 가져오는 도구를 정의할 수 있습니다. 모델의 채팅 템플릿(오픈 소스)은 도구 정의의 표현을 처리하고, 클라이언트는 도구 호출 및 결과를 모델에 다시 전달하여 최종 응답을 생성합니다.

청구 및 크레딧

Hub에서 Cohere 모델에 대한 청구는 인증 방식에 따라 처리됩니다:

  • 직접 요청: Cohere API 키를 사용하는 사용자는 자신의 Cohere 계정을 통해 직접 청구됩니다.
  • 라우팅된 요청: Hub를 통해 인증하는 사용자는 Hugging Face의 추가 마크업 없이 표준 Cohere API 요금이 적용됩니다.

또한 Hugging Face PRO 사용자는 매월 $2 상당의 추론 크레딧을 받으며, 이는 다양한 제공자에 걸쳐 사용할 수 있습니다.

Sources