microsoft/vidur

Accurate, large-scale, and extensible simulator for LLM inference Systems

무엇을 해결하는가

Vidur는 LLM 추론 시스템을 위한 고충실도 시뮬레이터입니다. 개발자와 연구자가 값비싼 GPU에 지속적으로 액세스할 필요 없이 시스템 성능을 분석하고, 배포를 위한 용량을 계획하며, 새로운 스케줄링 알고리즘이나 최적화(예: speculative decoding)를 테스트할 수 있도록 합니다.

작동 방식

Vidur는 다양한 하드웨어 구성(예: A100 또는 H100 GPU) 및 모델 아키텍처(예: Llama-3 또는 Qwen)에 걸쳐 LLM 워크로드의 실행을 시뮬레이션합니다. 프로파일링 단계를 통해 데이터를 수집한 다음, 추론 프로세스를 시뮬레이션하여 Time to First Token (TTFT), Time Per Output Token (TPOT), 그리고 엔드투엔드 요청 시간을 예측합니다. Tensor Parallelism (TP) 및 Pipeline Parallelism (PP)을 포함한 복잡한 배포 설정을 지원합니다.

대상 사용자

LLM 서빙 인프라를 최적화하거나, 가장 비용 효율적인 하드웨어 구성을 결정하거나, 새로운 추론 스케줄링 전략을 실험해야 하는 ML 시스템 연구자 및 엔지니어를 위해 설계되었습니다.

주요 특징

  • GPU-free simulation: 초기 프로파일링 단계 이후에는 활성 GPU 하드웨어가 필요 없이 성능과 용량을 분석할 수 있습니다.
  • Hardware and Model Support: 여러 GPU SKU(A100, H100, A40) 및 Llama-2, Llama-3, CodeLlama, InternLM, Qwen을 포함한 인기 있는 모델과 호환됩니다.
  • Detailed Metrics: 배치 사이즈, TTFT, TPOT와 같은 핵심 성능 지표를를 추적하며, 출력은 시각화를 위해 wandb 또는 Chrome traces로 내보낼 수 있습니다.
  • Flexible Configuration: 다양한 요청 생성기(synthetic 또는 trace-based) 및 스케줄링 알고리즘(예: Sarathi)을 지원합니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트