triton-inference-server/server
The Triton Inference Server provides an optimized cloud and edge inferencing solution.
解決的問題
Triton Inference Server 透過提供多個框架(例如 PyTorch、TensorRT、ONNX 和 OpenVINO)的標準化模型服務方式,簡化了在多種硬體平台(包括 NVIDIA GPU、x86/ARM CPU 和 AWS Inferentia)上部署 AI 模型的流程。
工作原理
它作為一款推理服務軟體,管理模型倉儲。採用模組化後端架構,支援從不同深度學習與機器學習框架執行模型。支援多種推理協定(HTTP/REST 與 gRPC),並提供 C 與 Java API 以供程序內使用情境。
適用對象
需要在雲端、資料中心、邊緣與嵌入式裝置上以最佳化效能部署生產級 AI 模型的 AI 團隊與開發者。
主要亮點
- 多框架支援:支援 TensorRT、PyTorch、ONNX、OpenVINO、Python 與 RAPIDS FIL 的模型服務。
- 效能最佳化:具備動態批次、序列批次與並行模型執行功能,以最大化吞吐量並最小化延遲。
- 彈性部署:支援雲端、資料中心、邊緣與嵌入式裝置部署。
- 模型流水線:透過整合(Ensembling)與業務邏輯腳本(BLS)實現複雜工作流程。
- 可擴展性:提供 Backend API,支援使用 C/C++ 或 Python 建立自訂後端。
相關
- 專案
- 專案
- 專案
- 專案
- 專案