ai-dynamo/aiperf
AIPerf is a comprehensive benchmarking tool that measures the performance of generative AI models served by your preferred inference solution.
解決する課題
AIPerfは、さまざまな推論ソリューションにわたる生成AIモデルのパフォーマンスを測定するために設計されたベンチマークツールです。開発者や研究者が、レイテンシ、スループット、システムがさまざまな負荷パターンをどのように処理するかなど、モデルデプロイメントの正確なパフォーマンス特性を特定するのに役立ちます。
仕組み
AIPerfは、スケーラブルなマルチプロセスアーキテクチャを採用しており、ZMQを介して通信する10個のサービスを使用してユーザーのトラフィックをシミュレートします。CLIフラグまたはYAMLファイルを使用して構成でき、サポートされているAPI(OpenAI互換エンドポイント、NIM、Hugging Face TGIを含む)にリクエストを送信できます。固定コンカレンシー、リクエストレート制御、および実際のプロダクショントレース(SageMakerやBasetenなどから取得)の再生を含む、複数のベンチマークモードをサポートしています。
対象ユーザー
本ツールは、プロダクションへのデプロイ前またはデプロイ中に、LLM、画像、音声、ビデオ生成エンドポイントのパフォーマンスとスケーラビリティを厳密にテストする必要があるAIエンジニア、ML Opsプロフェッショナル、および研究者を対象としています。
ハイライト
- 包括的なメトリクス: Time to First Token (TTFT)、Inter Token Latency (ITL)、および全体のリクエストスループットを追跡します。
- 言語・マルチモーダル対応: テキストLLM、埋め込み、ランキング、音声、画像生成、およびビデオ生成のベンチマークを実行します。
- 高度な負荷制御: Poisson分布およびgamma分布のトラフィック到着パターン、段階的なランプアップ、およびコールドスタート効果を排除するためのウォームアップフェーズをサポートしています。
- プロダクショントレースの再生: 公開データセット(ShareGPT)またはプロダクションログからの決定論的なワークロードを再生する機能を備えています。
- テレメトリ統合: MLflow、OpenTelemetry、およびWeights & Biasesと統合し、ライブメトリクスのストリーミングと結果のアップロードが可能です。
- 拡張可能なアーキテクチャ: カスタムエンドポイント、データセット、およびメトリクスのためのプラグインシステムを備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト