triton-inference-server/server

The Triton Inference Server provides an optimized cloud and edge inferencing solution.

해결하는 문제

Triton Inference Server는 NVIDIA GPU, x86/ARM CPU, AWS Inferentia와 같은 다양한 하드웨어 플랫폼에서 PyTorch, TensorRT, ONNX, OpenVINO 등의 다양한 프레임워크에서 AI 모델을 표준화된 방식으로 배포할 수 있도록 지원하여 AI 모델 배포를 간소화합니다.

작동 방식

모델 리포지토리를 관리하는 추론 서빙 소프트웨어로 작동합니다. 모듈식 백엔드 아키텍처를 사용하여 다양한 딥러닝 및 머신러닝 프레임워크의 모델을 실행할 수 있습니다. HTTP/REST 및 gRPC와 같은 여러 추론 프로토콜을 지원하며, 프로세스 내 사용을 위한 C 및 Java API를 제공합니다.

대상 사용자

클라우드, 데이터센터, 엣지, 임베디드 장치에서 최적화된 성능을 갖춘 프로덕션 수준의 AI 모델을 배포해야 하는 AI 팀 및 개발자입니다.

주요 특징

  • 다중 프레임워크 지원: TensorRT, PyTorch, ONNX, OpenVINO, Python, RAPIDS FIL에서 모델을 제공합니다.
  • 성능 최적화: 동적 배치, 시퀀스 배치, 동시 모델 실행을 통해 처리량을 극대화하고 지연 시간을 최소화합니다.
  • 유연한 배포: 클라우드, 데이터센터, 엣지, 임베디드 장치를 지원합니다.
  • 모델 파이프라인: 엔세블링과 비즈니스 로직 스크립팅(BLS)을 통해 복잡한 워크플로우를 구현할 수 있습니다.
  • 확장성: C/C++ 또는 Python으로 사용자 정의 백엔드를 생성할 수 있는 Backend API를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트