microsoft/vidur
Accurate, large-scale, and extensible simulator for LLM inference Systems
解消する課題
Vidurは、LLM推論システムの高精度シミュレータです。開発者や研究者が、高価なGPUへの継続的なアクセスを必要とせずに、システムパフォーマンスの分析、デプロイメントのキャパシティ計画、および新しいスケジューリングアルゴリズムや最適化(speculative decodingなど)のテストを行うことを可能にします。
仕組み
Vidurは、さまざまなハードウェア構成(A100やH100 GPUなど)やモデルアーキテクチャ(Llama-3やQwenなど)にわたって、LLMワークロードの実行をシミュレートします。プロファイリングフェーズを使用してデータを収集し、その後、推論プロセスをシミュレートして、Time to First Token (TTFT)、Time Per Output Token (TPOT)、およびエンドツーエンドのリクエスト時間を予測します。Tensor Parallelism (TP) や Pipeline Parallelism (PP) を含む複雑なデプロイメント構成をサポートしています。
対象ユーザー
LLMサービングインフラストラクチャの最適化、最もコスト効率の高いハードウェア構成の決定、または新しい推論スケジューリング戦略の実験が必要な、MLシステム研究者およびエンジニア向けに設計されています。
ハイライト
- GPU不要のシミュレーション: 初期のプロファイリングステップの後に、アクティブなGPUハードウェアを必要とせずに、パフォーマンスとキャパシティを分析できます。
- ハードウェアおよびモデルのサポート: 複数のGPU SKU (A100, H100, A40) および Llama-2, Llama-3, CodeLlama, InternLM, Qwen を含む人気のモデルと互換性があります。
- 詳細なメトリクス: バッチサイズ、TTFT、および TPOT のような主要なパフォーマンス指標を追跡し、出力を wandb や Chrome traces 用にエクスポートして可視化できます。
- 柔軟な構成: さまざまなリクエストジェネレータ(合成またはトレースベース)およびスケジューリングアルゴリズム(例: Sarathi)をサポートしています。
関連
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト