triton-inference-server/server

The Triton Inference Server provides an optimized cloud and edge inferencing solution.

解决的问题

Triton Inference Server 通过为多个框架(如 PyTorch、TensorRT、ONNX 和 OpenVINO)提供标准化的模型服务方式,简化了在多种硬件平台(包括 NVIDIA GPU、x86/ARM CPU 和 AWS Inferentia)上部署 AI 模型的流程。

工作原理

它作为一款推理服务软件,管理模型仓库。采用模块化后端架构,支持从不同深度学习和机器学习框架执行模型。支持多种推理协议(HTTP/REST 和 gRPC),并提供 C 和 Java API 以供进程内使用场景。

适用人群

需要在云、数据中心、边缘和嵌入式设备上以优化性能部署生产级 AI 模型的 AI 团队和开发者。

主要亮点

  • 多框架支持:支持 TensorRT、PyTorch、ONNX、OpenVINO、Python 和 RAPIDS FIL 的模型服务。
  • 性能优化:具备动态批处理、序列批处理和并发模型执行功能,以最大化吞吐量并最小化延迟。
  • 灵活部署:支持云、数据中心、边缘和嵌入式设备部署。
  • 模型流水线:通过集成(Ensembling)和业务逻辑脚本(BLS)实现复杂工作流。
  • 可扩展性:提供 Backend API,支持使用 C/C++ 或 Python 创建自定义后端。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目