Hugging Face와 Cloudflare Workers AI 통합
Hugging Face와 Cloudflare는 "Deploy on Cloudflare Workers AI" 통합을 출시하여 개발자들이 인기 있는 오픈 모델을 서버리스 API로 활용할 수 있게 했습니다. 이 통합은 Cloudflare의 전 세계 서버리스 GPU 네트워크를 활용함으로써 개발자들이 GPU 인프라를 관리하거나 유휴 용량에 대한 비용을 지불할 필요를 없앱니다.
Note: 2024년 11월 현재, 이 통합은 더 이상 제공되지 않습니다. 사용자는 Hugging Face Inference API, Inference Endpoints 또는 기타 배포 옵션으로 전환할 것을 권장합니다.
개발자를 위한 서버리스 GPU 추론
Cloudflare Workers AI는 GPU 부족과 서버 배포와 관련된 고정 비용이라는 일반적인 문제에 대한 저비용 서버리스 솔루션을 제공합니다. 요청당 과금 모델을 활용함으로써 개발자는 실제 사용한 컴퓨팅에만 비용을 지불합니다.
비용 효율성을 예시하기 위해, Hugging Face는 Meta Llama 2 7B를 사용하여 하루에 약 1,000건의 요청(입력 토큰 1,000개와 출력 토큰 100개)을 받는 Retrieval-Augmented Generation (RAG) 애플리케이션 예시를 제공합니다; 이러한 애플리케이션은 하루에 약 $1의 비용이 듭니다.
기술 구현 및 워크플로우
개발자는 Hugging Face Hub에 직접 통합된 간소화된 프로세스를 통해 Hugging Face 모델을 Cloudflare Workers AI에 배포할 수 있습니다.
배포 과정
- Model Selection: 사용자는 Hugging Face Hub의 선별된 Cloudflare Collection에서 Llama, Gemma, Mistral을 포함한 지원 모델을 찾을 수 있습니다.
- Deployment Trigger: 모델 페이지에서 사용자는 "Deploy" 메뉴를 선택하고 "Cloudflare Workers AI"를 선택합니다.
- Configuration: 인터페이스는 선택된 모델에 대한 구체적인 지침과 코드 스니펫을 제공합니다.
통합 옵션
배포가 완료되면, 통합은 두 가지 주요 방법으로 접근할 수 있습니다:
- Workers AI REST API:
ACCOUNT_ID와API_TOKEN변수를 정의해야 합니다. - Cloudflare AI SDK: Cloudflare Workers 내에서 직접 통합할 수 있습니다.
인프라 및 모델 지원
이 통합은 Hugging Face의 Text Generation Inference (TGI)와 같은 프로덕션 솔루션으로 구동됩니다. 모델은 Cloudflare의 엣지 데이터 센터 전역에 배치된 최신 GPU에서 호스팅됩니다. 초기 출시에는 인기 있는 오픈 모델이 포함되었지만, 특정 모델의 가용성은 Cloudflare Workers AI 생태계 내 지원 여부에 따라 결정됩니다; 배포 메뉴에 "Cloudflare Workers AI" 옵션이 없는 모델은 현재 지원되지 않습니다.