casys-kaist/LLMServingSim

LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure

解决的问题

LLMServingSim 解决了在无需大规模、昂贵的物理硬件集群的情况下测试和优化 LLM 服务基础设施的难题。它使研究人员能够模拟不同硬件配置、内存层级和并行策略对大规模 LLM 推理性能的影响。

工作原理

该项目采用循环级仿真方法,结合三个主要组件:

  1. Python 前端:模拟 vLLM 中使用的连续批处理调度器。
  2. C++ 后端:使用 ASTRA-Sim 进行分析性网络仿真。
  3. 逐层分析器:通过从 vLLM 中捕获的真实硬件延迟数据为系统提供输入,确保仿真精度。

适用对象

专为研究 LLM 基础设施的研究人员和工程师设计,特别是关注异构加速器、分离式内存(如 CXL 或 PIM)以及大规模并行技术的群体。

主要亮点

  • 广泛的并行支持:支持各种组合的张量并行(TP)、流水线并行(PP)、专家并行(EP)和数据并行(DP)。
  • 硬件灵活性:支持异构加速器和分离式内存层级(CPU、CXL、PIM)。
  • 高精度:在 RTX 4090 等硬件上的分析显示,延迟和 TTFT/TPOT 的结果与真实 vLLM 运行相比误差在 1% 以内。
  • 高效性能:最近的更新使仿真速度提升了约 11 倍,同时保持字节级完全一致的结果。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目