triton-inference-server/server
The Triton Inference Server provides an optimized cloud and edge inferencing solution.
解决的问题
Triton Inference Server 通过为多个框架(如 PyTorch、TensorRT、ONNX 和 OpenVINO)提供标准化的模型服务方式,简化了在多种硬件平台(包括 NVIDIA GPU、x86/ARM CPU 和 AWS Inferentia)上部署 AI 模型的流程。
工作原理
它作为一款推理服务软件,管理模型仓库。采用模块化后端架构,支持从不同深度学习和机器学习框架执行模型。支持多种推理协议(HTTP/REST 和 gRPC),并提供 C 和 Java API 以供进程内使用场景。
适用人群
需要在云、数据中心、边缘和嵌入式设备上以优化性能部署生产级 AI 模型的 AI 团队和开发者。
主要亮点
- 多框架支持:支持 TensorRT、PyTorch、ONNX、OpenVINO、Python 和 RAPIDS FIL 的模型服务。
- 性能优化:具备动态批处理、序列批处理和并发模型执行功能,以最大化吞吐量并最小化延迟。
- 灵活部署:支持云、数据中心、边缘和嵌入式设备部署。
- 模型流水线:通过集成(Ensembling)和业务逻辑脚本(BLS)实现复杂工作流。
- 可扩展性:提供 Backend API,支持使用 C/C++ 或 Python 创建自定义后端。
相关
- 项目
- 项目
- 项目
- 项目
- 项目