Hugging Face가 Fireworks.ai를 인퍼런스 제공자로 통합
Hugging Face는 Hub에서 지원되는 인퍼런스 제공자로 Fireworks.ai를 통합했습니다. 이 통합을 통해 사용자는 모델 페이지에서 직접 그리고 Hugging Face 라이브러리와 도구 생태계 전반에서 다양한 모델에 대한 초고속 서버리스 인퍼런스에 접근할 수 있습니다.
지원되는 모델
Fireworks.ai는 Hugging Face Hub에서 numerose 모델에 대한 서버리스 인퍼런스를 제공하며, 다음을 포함합니다:
- DeepSeek-R1 (
deepseek-ai/DeepSeek-R1) - DeepSeek-V3 (
deepseek-ai/DeepSeek-V3) - Mistral-Small-24B-Instruct-2501 (
mistralai/Mistral-Small-24B-Instruct-2501) - Qwen2.5-Coder-32B-Instruct (
Qwen/Qwen2.5-Coder-32B-Instruct) - Llama-3.2-90B-Vision-Instruct (
meta-llama/Llama-3.2-90B-Vision-Instruct)
구현 및 액세스 방법
사용자는 세 가지 주요 인터페이스를 통해 Fireworks.ai 인퍼런스 기능에 접근할 수 있습니다.
웹사이트 사용자 인터페이스
사용자는 Hugging Face 웹사이트 UI 내에서 Fireworks.ai가 지원하는 모든 모델을 직접 검색하고 추론을 실행할 수 있습니다.
클라이언트 SDK
Fireworks.ai는 다음과 같은 SDK를 사용하여 애플리케이션에 통합할 수 있습니다.
- Python (
huggingface_hub): 소스에서 라이브러리를 설치하고InferenceClient에서provider="fireworks-ai"매개변수를 정의하면, 사용자는 요청을 Fireworks.ai로 라우팅할 수 있습니다. 인증은 Hugging Face 토큰 또는 Fireworks.ai API 키를 통해 처리할 수 있습니다. - JavaScript (
@huggingface/inference): 사용자는chatCompletion메서드 내에서provider: "fireworks-ai"매개변수를 지정하여 제공자를 활용할 수 있습니다.
HTTP 호출
cURL을 통해 Hugging Face 라우터 엔드포인트(https://router.huggingface.co/fireworks-ai/v1/chat/completions)로 직접 HTTP 요청을 보낼 수 있으며, 모델과 인증 bearer 토큰을 지정해야 합니다.
청구 및 크레딧
Fireworks.ai 인퍼런스에 대한 청구는 사용된 인증 방법에 따라 처리됩니다.
- Direct Requests: Fireworks.ai API 키를 사용할 때, 사용자는 자신의 Fireworks 계정을 통해 직접 청구됩니다.
- Routed Requests: Hugging Face Hub를 통해 인증할 때, 사용자는 Hugging Face로부터 추가 마크업 없이 표준 Fireworks API 요금을 지불합니다.
또한, Hugging Face PRO 사용자는 매월 2달러 상당의 인퍼런스 크레딧을 받으며, 이는 다양한 제공자에 적용할 수 있습니다.