huggingface/text-embeddings-inference

A blazing fast inference solution for text embeddings models

何を解決するか

Text Embeddings Inference (TEI) は、オープンソースのテキスト埋め込みモデルおよびシーケンス分類モデルをデプロイおよび配信するための高性能なソリューションを提供します。複雑なモデルグラフのコンパイルを必要とせず、人気のあるモデルからの埋め込み抽出プロセスを最適化することで、プロダクション環境やサーバーレスアーキテクチャに適した仕組みを実現します。

動作方法

TEI は、REST API や gRPC を介してモデルを提供するツールキットとして機能します。最適化されたトランスフォーマー コードと専用バックエンドを使用して、ハードウェア効率を最大化します。主な技術的最適化は以下の通りです:

  • ハードウェア加速:NVIDIA GPU(Turing から Blackwell までの複数アーキテクチャ)、Apple Silicon(Metal を介して)、CPU をサポート。
  • パフォーマンスカーネル:Flash Attention、Candle、cuBLASLt を統合し、より高速な推論を実現。
  • 効率的なロード:Safetensors と ONNX を使用して重みをロードし、起動時間を短縮。
  • リクエスト管理:トークンベースの動的バッチ処理を実装し、スループットを最適化し、並行リクエストを効率的に処理。

対象ユーザー

低レイテンシ、高スループットで埋め込みモデル(BGE、GTE、E5 など)やリランカーをプロダクション環境にデプロイしたい開発者や ML エンジニア向けに設計されています。

主な特徴

  • 極めて高速:最小限のレイテンシで高パフォーマンスな抽出を最適化。
  • プロダクション対応:組み込みの Prometheus メトリクスと Open Telemetry を通じた分散トレーシングを備えています。
  • 広範なモデル対応:BERT、RoBERTa、Mistral、Qwen、Gemma など、多数のアーキテクチャに対応。
  • サーバーレス対応:小さな Docker イメージと高速な起動時間を備え、迅速なスケーリングを可能にします。

関連

  • Dispatch
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト