huggingface/text-embeddings-inference

A blazing fast inference solution for text embeddings models

해결하는 문제

Text Embeddings Inference (TEI)는 오픈소스 텍스트 임베딩 및 시퀀스 분류 모델을 배포하고 제공하기 위한 고성능 솔루션을 제공합니다. 복잡한 모델 그래프 컴파일이 필요 없으며, 인기 있는 모델에서 임베딩을 추출하는 과정을 최적화하여 프로덕션 환경과 서버리스 아키텍처에 적합하게 만듭니다.

작동 방식

TEI는 REST API 또는 gRPC를 통해 모델을 제공하는 툴킷으로 작동합니다. 최적화된 트랜스포머 코드와 특화된 백엔드를 사용하여 하드웨어 효율을 극대화합니다. 주요 기술적 최적화는 다음과 같습니다:

  • 하드웨어 가속: NVIDIA GPU(튜링에서 블랙웰까지 다양한 아키텍처), Apple Silicon(Metal을 통해), CPU 지원.
  • 성능 커널: Flash Attention, Candle, cuBLASLt 통합으로 더 빠른 추론 구현.
  • 효율적인 로딩: Safetensors 및 ONNX를 사용해 가중치를 로드하여 부팅 시간을 단축.
  • 요청 관리: 토큰 기반의 동적 배치 처리를 통해 처리량을 최적화하고 동시 요청을 효율적으로 처리.

대상 사용자

저지연, 고처리량으로 BGE, GTE, E5와 같은 임베딩 모델이나 리랭커를 프로덕션 환경에 배포하고자 하는 개발자 및 ML 엔지니어를 위한 것입니다.

주요 특징

  • 초고속: 최소한의 지연으로 고성능 추출을 최적화.
  • 프로덕션 준비 완료: 내장된 Prometheus 메트릭과 Open Telemetry를 통한 분산 추적 기능 포함.
  • 광범위한 모델 지원: BERT, RoBERTa, Mistral, Qwen, Gemma 등 다양한 아키텍처와 호환.
  • 서버리스 친화적: 작고 빠른 부팅 시간을 갖춘 Docker 이미지로 빠른 확장성 제공.

관련

  • Dispatch
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트