microsoft/vidur

Accurate, large-scale, and extensible simulator for LLM inference Systems

解消する課題

Vidurは、LLM推論システムの高精度シミュレータです。開発者や研究者が、高価なGPUへの継続的なアクセスを必要とせずに、システムパフォーマンスの分析、デプロイメントのキャパシティ計画、および新しいスケジューリングアルゴリズムや最適化(speculative decodingなど)のテストを行うことを可能にします。

仕組み

Vidurは、さまざまなハードウェア構成(A100やH100 GPUなど)やモデルアーキテクチャ(Llama-3やQwenなど)にわたって、LLMワークロードの実行をシミュレートします。プロファイリングフェーズを使用してデータを収集し、その後、推論プロセスをシミュレートして、Time to First Token (TTFT)、Time Per Output Token (TPOT)、およびエンドツーエンドのリクエスト時間を予測します。Tensor Parallelism (TP) や Pipeline Parallelism (PP) を含む複雑なデプロイメント構成をサポートしています。

対象ユーザー

LLMサービングインフラストラクチャの最適化、最もコスト効率の高いハードウェア構成の決定、または新しい推論スケジューリング戦略の実験が必要な、MLシステム研究者およびエンジニア向けに設計されています。

ハイライト

  • GPU不要のシミュレーション: 初期のプロファイリングステップの後に、アクティブなGPUハードウェアを必要とせずに、パフォーマンスとキャパシティを分析できます。
  • ハードウェアおよびモデルのサポート: 複数のGPU SKU (A100, H100, A40) および Llama-2, Llama-3, CodeLlama, InternLM, Qwen を含む人気のモデルと互換性があります。
  • 詳細なメトリクス: バッチサイズ、TTFT、および TPOT のような主要なパフォーマンス指標を追跡し、出力を wandb や Chrome traces 用にエクスポートして可視化できます。
  • 柔軟な構成: さまざまなリクエストジェネレータ(合成またはトレースベース)およびスケジューリングアルゴリズム(例: Sarathi)をサポートしています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト