casys-kaist/LLMServingSim

LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure

解決的問題

LLMServingSim 解決了在沒有龐大且昂貴的實體硬體叢集的情況下,測試和優化大型語言模型(LLM)服務基礎設施的困難。它讓研究人員能夠模擬不同硬體配置、記憶體層級和平行化策略如何影響 LLM 推理在大規模下的效能。

工作原理

該專案採用週期級模擬方法,結合三個主要元件:

  1. Python 前端:模擬 vLLM 中使用的連續批次排程器。
  2. C++ 後端:使用 ASTRA-Sim 進行分析性網路模擬。
  3. 逐層剖析器:將從 vLLM 收集的真實硬體延遲資料輸入系統,以確保模擬的準確性。

適用對象

專為研究 LLM 基礎設施的研究人員和工程師設計,特別是專注於異質加速器、分散式記憶體(如 CXL 或 PIM)以及大規模平行化技術的團隊。

主要特色

  • 廣泛的平行化支援:可模擬 Tensor Parallelism (TP)、Pipeline Parallelism (PP)、Expert Parallelism (EP) 和 Data Parallelism (DP) 的各種組合。
  • 硬體彈性:支援異質加速器和分散式記憶體層級(CPU、CXL、PIM)。
  • 高準確度:針對 RTX 4090 等硬體的剖析顯示,模擬結果在延遲以及 TTFT/TPOT 方面與實際 vLLM 執行結果相差不到 1%。
  • 高效能:近期更新使模擬速度提升約 11 倍,同時保持位元組完全一致的結果。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案