huggingface/text-embeddings-inference

A blazing fast inference solution for text embeddings models

解決的問題

Text Embeddings Inference (TEI) 提供高效率的解決方案,用於部署與提供開源的文本嵌入與序列分類模型。它消除了複雜模型圖編譯的需求,並優化了從流行模型中提取嵌入的流程,使其適合用於生產環境與無伺服器架構。

工作原理

TEI 作為一個工具包,透過 REST API 或 gRPC 提供模型服務。它利用優化過的 Transformer 程式碼與專用後端,以最大化硬體效率。主要的技術優化包括:

  • 硬體加速:支援 NVIDIA GPU(涵蓋從 Turing 到 Blackwell 的多種架構)、Apple Silicon(透過 Metal)、以及 CPU。
  • 效能核心:整合 Flash Attention、Candle 與 cuBLASLt,以實現更快的推論。
  • 高效載入:使用 Safetensors 與 ONNX 載入權重,以縮短啟動時間。
  • 請求管理:實作基於令牌的動態批次處理,以優化吞吐量並高效處理並行請求。

適用對象

專為需要以低延遲與高吞吐量將嵌入模型(如 BGE、GTE 或 E5)或重排序器部署至生產環境的開發者與機器學習工程師所設計。

主要亮點

  • 極速:優化為低延遲的高效率提取。
  • 生產就緒:內建 Prometheus 指標與透過 Open Telemetry 實現的分散式追蹤。
  • 廣泛模型支援:相容多種架構,包括 BERT、RoBERTa、Mistral、Qwen 與 Gemma。
  • 無伺服器友善:小型 Docker 映像與快速啟動時間,便於快速擴展。

相關

  • Dispatch
  • Dispatch
  • 專案
  • 專案
  • 專案