triton-inference-server/model_analyzer

Triton Model Analyzer is a CLI tool to help with better understanding of the compute and memory requirements of the Triton Inference Server models.

What it solves

Triton Inference Server 上で動作する AI モデルに対し、最も効率的な構成を見つけるのに役立ちます。設定を手動で推測する代わりに、パフォーマンス(レイテンシ)とリソース使用量(計算とメモリ)の最適なバランスを自動で探し出します。

How it works

Model Analyzer は、最大バッチサイズ、ダイナミックバッチング、インスタンスグループなどの構成パラメータを探索する複数の検索モードを使用します。4 つの検索戦略を提供します:

  • Optuna Search:ハイパーパラメータ最適化フレームワークを使用した包括的検索。
  • Quick Search:ヒューリスティックな山登りアルゴリズムで迅速に最適設定を発見。
  • Automatic Brute Search:指定されたパラメータのすべての組み合わせを徹底的にテスト。
  • Manual Brute Search:ユーザーが独自のパラメータスイープを定義可能。

Who it’s for

Triton Inference Server を使用してモデルをデプロイし、ハードウェア利用率を最適化し、特定の QoS(Quality of Service)要件を満たす必要がある ML エンジニアや DevOps プロフェッショナル向けです。

Highlights

  • Versatile Model Support:単一モデル、複数同時実行モデル、エンセンブルモデル、BLS モデル、そして大規模言語モデル(LLM)に対応。
  • QoS Constraints:最大レイテンシ予算など、特定の要件に基づいて結果をフィルタリング可能。
  • Detailed Reporting:構成間のトレードオフを可視化する要約および詳細レポートを生成。
  • Hardware-Specific Optimization:使用するハードウェアに合わせて構成を最適化。