microsoft/vidur
Accurate, large-scale, and extensible simulator for LLM inference Systems
解決的問題
Vidur 是一個高保真 LLM 推論系統模擬器。它讓開發者與研究人員能在不需要持續使用昂貴 GPU 的情況下,分析系統效能、規劃部署容量,並測試新的排程演算法或優化(例如推測解碼)。
工作原理
Vidur 可在多種硬體配置(如 A100 或 H100 GPU)和模型架構(如 Llama-3 或 Qwen)上模擬 LLM 工作負載的執行。它透過一個分析階段收集資料,然後模擬推論過程,以預測首個 token 時間(TTFT)、每輸出 token 時間(TPOT)和端到端請求時間等指標。它支援複雜的部署設定,包括張量平行(TP)和流水線平行(PP)。
適用對象
專為需要優化 LLM 服務基礎設施、決定最具成本效益的硬體配置,或實驗新型推論排程策略的機器學習系統研究人員與工程師設計。
主要亮點
- 無需 GPU 的模擬:在初始分析階段後,無需持續使用 GPU 硬體即可分析效能與容量。
- 支援多種硬體與模型:相容多種 GPU 型號(A100、H100、A40)以及 Llama-2、Llama-3、CodeLlama、InternLM 和 Qwen 等熱門模型。
- 詳細指標追蹤:追蹤批量大小、TTFT、TPOT 等關鍵效能指標,支援匯出至 wandb 或 Chrome 跟蹤檔以進行視覺化。
- 靈活配置:支援多種請求產生器(合成或基於 trace)和排程演算法(如 Sarathi)。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案