triton-inference-server/model_analyzer
Triton Model Analyzer is a CLI tool to help with better understanding of the compute and memory requirements of the Triton Inference Server models.
What it solves
Triton Inference Server 上で動作する AI モデルに対し、最も効率的な構成を見つけるのに役立ちます。設定を手動で推測する代わりに、パフォーマンス(レイテンシ)とリソース使用量(計算とメモリ)の最適なバランスを自動で探し出します。
How it works
Model Analyzer は、最大バッチサイズ、ダイナミックバッチング、インスタンスグループなどの構成パラメータを探索する複数の検索モードを使用します。4 つの検索戦略を提供します:
- Optuna Search:ハイパーパラメータ最適化フレームワークを使用した包括的検索。
- Quick Search:ヒューリスティックな山登りアルゴリズムで迅速に最適設定を発見。
- Automatic Brute Search:指定されたパラメータのすべての組み合わせを徹底的にテスト。
- Manual Brute Search:ユーザーが独自のパラメータスイープを定義可能。
Who it’s for
Triton Inference Server を使用してモデルをデプロイし、ハードウェア利用率を最適化し、特定の QoS(Quality of Service)要件を満たす必要がある ML エンジニアや DevOps プロフェッショナル向けです。
Highlights
- Versatile Model Support:単一モデル、複数同時実行モデル、エンセンブルモデル、BLS モデル、そして大規模言語モデル(LLM)に対応。
- QoS Constraints:最大レイテンシ予算など、特定の要件に基づいて結果をフィルタリング可能。
- Detailed Reporting:構成間のトレードオフを可視化する要約および詳細レポートを生成。
- Hardware-Specific Optimization:使用するハードウェアに合わせて構成を最適化。