tensorflow/serving

A flexible, high-performance serving system for machine learning models

What it solves

它解决了将机器学习模型部署到生产环境的挑战。具体而言,它处理推理阶段——将已训练好的模型提供给客户端使用,确保可靠且高效,并且在模型更新时无需更改客户端代码。

How it works

TensorFlow Serving 使用高性能、具引用计数的查找表来管理模型的生命周期。它提供版本化的模型访问,并通过 gRPC 和 HTTP 暴露推理端点。为了优化性能,系统内置调度器,将单个请求批量化以在 GPU 上共同执行,并支持多种“servables”,包括 TensorFlow 模型、嵌入向量和词汇表。

Who it’s for

此系统面向需要将机器学习模型部署到高性能、低延迟且能够管理多个模型版本(包括 A/B 测试和金丝雀发布)的生产环境的开发者和 ML 工程师。

Highlights

  • 支持同时服务多个模型或同一模型的多个版本。
  • 同时提供 gRPC 和 HTTP 推理端点。
  • 可在不更新客户端代码的情况下部署新模型版本。
  • 支持金丝雀发布和 A/B 测试实验模型。
  • 包含 GPU 批量请求调度器,具可配置的延迟控制。
  • 可扩展架构,能够服务非 TensorFlow 的模型和数据。