casys-kaist/LLMServingSim
LLMServingSim 2.0: A Unified Simulator for Heterogeneous and Disaggregated LLM Serving Infrastructure
解決的問題
LLMServingSim 解決了在沒有龐大且昂貴的實體硬體叢集的情況下,測試和優化大型語言模型(LLM)服務基礎設施的困難。它讓研究人員能夠模擬不同硬體配置、記憶體層級和平行化策略如何影響 LLM 推理在大規模下的效能。
工作原理
該專案採用週期級模擬方法,結合三個主要元件:
- Python 前端:模擬 vLLM 中使用的連續批次排程器。
- C++ 後端:使用 ASTRA-Sim 進行分析性網路模擬。
- 逐層剖析器:將從 vLLM 收集的真實硬體延遲資料輸入系統,以確保模擬的準確性。
適用對象
專為研究 LLM 基礎設施的研究人員和工程師設計,特別是專注於異質加速器、分散式記憶體(如 CXL 或 PIM)以及大規模平行化技術的團隊。
主要特色
- 廣泛的平行化支援:可模擬 Tensor Parallelism (TP)、Pipeline Parallelism (PP)、Expert Parallelism (EP) 和 Data Parallelism (DP) 的各種組合。
- 硬體彈性:支援異質加速器和分散式記憶體層級(CPU、CXL、PIM)。
- 高準確度:針對 RTX 4090 等硬體的剖析顯示,模擬結果在延遲以及 TTFT/TPOT 方面與實際 vLLM 執行結果相差不到 1%。
- 高效能:近期更新使模擬速度提升約 11 倍,同時保持位元組完全一致的結果。
相關
- 專案
- 專案
- 專案
- 專案
- 專案