tensorflow/serving
A flexible, high-performance serving system for machine learning models
What it solves
它解决了将机器学习模型部署到生产环境的挑战。具体而言,它处理推理阶段——将已训练好的模型提供给客户端使用,确保可靠且高效,并且在模型更新时无需更改客户端代码。
How it works
TensorFlow Serving 使用高性能、具引用计数的查找表来管理模型的生命周期。它提供版本化的模型访问,并通过 gRPC 和 HTTP 暴露推理端点。为了优化性能,系统内置调度器,将单个请求批量化以在 GPU 上共同执行,并支持多种“servables”,包括 TensorFlow 模型、嵌入向量和词汇表。
Who it’s for
此系统面向需要将机器学习模型部署到高性能、低延迟且能够管理多个模型版本(包括 A/B 测试和金丝雀发布)的生产环境的开发者和 ML 工程师。
Highlights
- 支持同时服务多个模型或同一模型的多个版本。
- 同时提供 gRPC 和 HTTP 推理端点。
- 可在不更新客户端代码的情况下部署新模型版本。
- 支持金丝雀发布和 A/B 测试实验模型。
- 包含 GPU 批量请求调度器,具可配置的延迟控制。
- 可扩展架构,能够服务非 TensorFlow 的模型和数据。