tensorflow/serving

A flexible, high-performance serving system for machine learning models

What it solves

它解決了將機器學習模型部署到生產環境的挑戰。具體而言,它處理推論階段——將已訓練好的模型提供給客戶端使用,確保可靠且高效,且在模型更新時不需要更改客戶端程式碼。

How it works

TensorFlow Serving 使用高效能、具參考計數的查找表來管理模型的生命週期。它提供版本化的模型存取,並透過 gRPC 與 HTTP 暴露推論端點。為了最佳化效能,系統內建排程器,將單一請求批次化以在 GPU 上共同執行,並支援多種「servables」,包括 TensorFlow 模型、嵌入向量與詞彙表。

Who it’s for

此系統設計給需要將機器學習模型部署到高效能、低延遲且能管理多個模型版本(含 A/B 測試與金絲雀發布)的生產環境的開發者與 ML 工程師。

Highlights

  • 支援同時服務多個模型或同一模型的多個版本。
  • 同時提供 gRPC 與 HTTP 推論端點。
  • 可在不更新客戶端程式碼的情況下部署新模型版本。
  • 支援金絲雀發布與 A/B 測試實驗模型。
  • 包含 GPU 批次請求排程器,具可設定的延遲控制。
  • 可擴充架構,能服務非 TensorFlow 的模型與資料。