casys-kaist/LLMServingSim
LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure
解决的问题
LLMServingSim 解决了在无需大规模、昂贵的物理硬件集群的情况下测试和优化 LLM 服务基础设施的难题。它使研究人员能够模拟不同硬件配置、内存层级和并行策略对大规模 LLM 推理性能的影响。
工作原理
该项目采用循环级仿真方法,结合三个主要组件:
- Python 前端:模拟 vLLM 中使用的连续批处理调度器。
- C++ 后端:使用 ASTRA-Sim 进行分析性网络仿真。
- 逐层分析器:通过从 vLLM 中捕获的真实硬件延迟数据为系统提供输入,确保仿真精度。
适用对象
专为研究 LLM 基础设施的研究人员和工程师设计,特别是关注异构加速器、分离式内存(如 CXL 或 PIM)以及大规模并行技术的群体。
主要亮点
- 广泛的并行支持:支持各种组合的张量并行(TP)、流水线并行(PP)、专家并行(EP)和数据并行(DP)。
- 硬件灵活性:支持异构加速器和分离式内存层级(CPU、CXL、PIM)。
- 高精度:在 RTX 4090 等硬件上的分析显示,延迟和 TTFT/TPOT 的结果与真实 vLLM 运行相比误差在 1% 以内。
- 高效性能:最近的更新使仿真速度提升了约 11 倍,同时保持字节级完全一致的结果。
相关
- 项目
- 项目
- 项目
- 项目
- 项目