ai-dynamo/aiconfigurator
Offline optimization of your disaggregated Dynamo graph
解決的問題
為分散式LLM服務配置LLM部署非常複雜,因為使用者必須在預填入與解碼工作進程數量、平行性設定以及SLA目標(例如首個令牌時間、每輸出令牌時間)之間取得平衡,以在不犧牲延遲的前提下最大化吞吐量。
工作原理
AIConfigurator 使用特定硬體與框架的收集性能資料來建模LLM推論。它會搜尋數千種潛在設定,根據使用者的模型、GPU數量與GPU類型找到最佳設定。它可以以多種模式運作:
- 預設:比較整合式與分散式部署,以找到最佳整體設定。
- 推薦:作為採購工具,計算滿足特定性能目標所需的最小GPU數量。
- 產生:無需完整參數掃描,快速建立基本設定。
- Exp:執行在YAML檔案中定義的自訂實驗。
適用對象
需要優化LLM服務部署的ML工程師與基礎設施架構師,特別是使用Dynamo或llm-d,以在滿足嚴格延遲SLA的同時實現最高吞吐量的使用者。
特色
- 多後端支援:支援
trtllm、vllm與sglang。 - 自動搜尋:評估數千種設定,以找到吞吐量與延遲之間的帕累托前緣。
- 部署產物:產生適用於多種目標的設定檔,包括Dynamo清單、llm-d Helm/Kustomize以及FPM。
- 採購規模建議:推薦滿足特定請求速率與SLA所需的最小硬體配置。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案