triton-inference-server/server

The Triton Inference Server provides an optimized cloud and edge inferencing solution.

解決的問題

Triton Inference Server 透過提供多個框架(例如 PyTorch、TensorRT、ONNX 和 OpenVINO)的標準化模型服務方式,簡化了在多種硬體平台(包括 NVIDIA GPU、x86/ARM CPU 和 AWS Inferentia)上部署 AI 模型的流程。

工作原理

它作為一款推理服務軟體,管理模型倉儲。採用模組化後端架構,支援從不同深度學習與機器學習框架執行模型。支援多種推理協定(HTTP/REST 與 gRPC),並提供 C 與 Java API 以供程序內使用情境。

適用對象

需要在雲端、資料中心、邊緣與嵌入式裝置上以最佳化效能部署生產級 AI 模型的 AI 團隊與開發者。

主要亮點

  • 多框架支援:支援 TensorRT、PyTorch、ONNX、OpenVINO、Python 與 RAPIDS FIL 的模型服務。
  • 效能最佳化:具備動態批次、序列批次與並行模型執行功能,以最大化吞吐量並最小化延遲。
  • 彈性部署:支援雲端、資料中心、邊緣與嵌入式裝置部署。
  • 模型流水線:透過整合(Ensembling)與業務邏輯腳本(BLS)實現複雜工作流程。
  • 可擴展性:提供 Backend API,支援使用 C/C++ 或 Python 建立自訂後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案