triton-inference-server/model_analyzer

Triton Model Analyzer is a CLI tool to help with better understanding of the compute and memory requirements of the Triton Inference Server models.

What it solves

Triton Inference Server에서 실행되는 AI 모델에 대해 가장 효율적인 구성을 찾는 데 도움을 줍니다. 설정을 수동으로 추측하는 대신, 성능(지연 시간)과 자원 사용량(컴퓨팅 및 메모리) 사이의 최적 균형을 자동으로 찾아줍니다.

How it works

Model Analyzer는 최대 배치 크기, 동적 배칭, 인스턴스 그룹 등 다양한 구성 파라미터를 탐색하는 여러 검색 모드를 사용합니다. 네 가지 검색 전략을 제공합니다:

  • Optuna Search: 하이퍼파라미터 최적화 프레임워크를 이용한 포괄적인 검색.
  • Quick Search: 휴리스틱 힐클라이밍 알고리즘으로 빠르게 최적 설정을 찾음.
  • Automatic Brute Search: 지정된 파라미터 조합을 모두 테스트.
  • Manual Brute Search: 사용자가 직접 파라미터 스윕을 정의 가능.

Who it’s for

Triton Inference Server를 사용해 모델을 배포하고 하드웨어 활용도를 최적화하며 특정 QoS(품질 보증) 요구 사항을 충족해야 하는 ML 엔지니어 및 DevOps 전문가를 위한 도구입니다.

Highlights

  • Versatile Model Support: 단일 모델, 다중 동시 모델, 앙상블 모델, BLS 모델 및 대형 언어 모델(LLM)을 지원합니다.
  • QoS Constraints: 최대 지연 시간 예산과 같은 특정 요구 사항에 따라 결과를 필터링할 수 있습니다.
  • Detailed Reporting: 다양한 구성 간의 트레이드오프를 시각화하는 요약 및 상세 보고서를 생성합니다.
  • Hardware-Specific Optimization: 사용 중인 특정 하드웨어에 맞게 구성을 맞춤 최적화합니다.