huggingface/text-embeddings-inference

A blazing fast inference solution for text embeddings models

解决的问题

Text Embeddings Inference (TEI) 为部署和提供开源文本嵌入和序列分类模型提供高性能解决方案。它消除了复杂模型图编译的需求,并优化了从流行模型中提取嵌入的过程,使其适用于生产环境和无服务器架构。

工作原理

TEI 作为一个工具包,通过 REST API 或 gRPC 提供模型服务。它利用优化的 Transformer 代码和专用后端,以最大化硬件效率。关键技术优化包括:

  • 硬件加速:支持 NVIDIA GPU(涵盖从 Turing 到 Blackwell 的多种架构)、Apple Silicon(通过 Metal)、以及 CPU。
  • 性能内核:集成 Flash Attention、Candle 和 cuBLASLt 以实现更快的推理。
  • 高效加载:使用 Safetensors 和 ONNX 加载权重,以缩短启动时间。
  • 请求管理:实现基于令牌的动态批处理,以优化吞吐量并高效处理并发请求。

适用人群

专为需要以低延迟和高吞吐量将嵌入模型(如 BGE、GTE 或 E5)或重排序器部署到生产环境的开发者和机器学习工程师设计。

主要亮点

  • 极快:优化为低延迟的高性能提取。
  • 生产就绪:内置 Prometheus 指标和通过 Open Telemetry 实现的分布式追踪。
  • 广泛模型支持:兼容多种架构,包括 BERT、RoBERTa、Mistral、Qwen 和 Gemma。
  • 无服务器友好:小型 Docker 镜像和快速启动时间,便于快速扩展。

相关

  • Dispatch
  • Dispatch
  • 项目
  • 项目
  • 项目