microsoft/vidur
Accurate, large-scale, and extensible simulator for LLM inference Systems
它解决了什么问题
Vidur 是一个高保真度的 LLM 推理系统模拟器。它使开发者和研究人员能够在无需持续访问昂贵 GPU 的情况下,分析系统性能、规划部署容量,并测试新的调度算法或优化(如推测解码)。
它如何工作
Vidur 可以在各种硬件配置(如 A100 或 H100 GPU)和模型架构(如 Llama-3 或 Qwen)上模拟 LLM 工作负载的执行。它通过一个性能分析阶段收集数据,然后模拟推理过程,以预测诸如首 token 延迟(TTFT)、每输出 token 延迟(TPOT)和端到端请求时间等指标。它支持复杂的部署设置,包括张量并行(TP)和流水线并行(PP)。
适用人群
专为需要优化 LLM 服务基础设施、确定最具成本效益的硬件配置或实验新型推理调度策略的机器学习系统研究人员和工程师设计。
主要特性
- 无需 GPU 的模拟:在完成初始性能分析步骤后,无需持续使用实际 GPU 硬件即可分析性能和容量。
- 支持多种硬件与模型:兼容多种 GPU 型号(A100、H100、A40)以及 Llama-2、Llama-3、CodeLlama、InternLM 和 Qwen 等主流模型。
- 详细指标追踪:跟踪批量大小、TTFT 和 TPOT 等关键性能指标,输出可导出至 wandb 或 Chrome 跟踪文件以供可视化。
- 灵活配置:支持多种请求生成器(合成或基于 trace)和调度算法(例如 Sarathi)。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目