ai-dynamo/aiconfigurator

Offline optimization of your disaggregated Dynamo graph

解決的問題

為分散式LLM服務配置LLM部署非常複雜,因為使用者必須在預填入與解碼工作進程數量、平行性設定以及SLA目標(例如首個令牌時間、每輸出令牌時間)之間取得平衡,以在不犧牲延遲的前提下最大化吞吐量。

工作原理

AIConfigurator 使用特定硬體與框架的收集性能資料來建模LLM推論。它會搜尋數千種潛在設定,根據使用者的模型、GPU數量與GPU類型找到最佳設定。它可以以多種模式運作:

  • 預設:比較整合式與分散式部署,以找到最佳整體設定。
  • 推薦:作為採購工具,計算滿足特定性能目標所需的最小GPU數量。
  • 產生:無需完整參數掃描,快速建立基本設定。
  • Exp:執行在YAML檔案中定義的自訂實驗。

適用對象

需要優化LLM服務部署的ML工程師與基礎設施架構師,特別是使用Dynamo或llm-d,以在滿足嚴格延遲SLA的同時實現最高吞吐量的使用者。

特色

  • 多後端支援:支援 trtllmvllmsglang
  • 自動搜尋:評估數千種設定,以找到吞吐量與延遲之間的帕累托前緣。
  • 部署產物:產生適用於多種目標的設定檔,包括Dynamo清單、llm-d Helm/Kustomize以及FPM。
  • 採購規模建議:推薦滿足特定請求速率與SLA所需的最小硬體配置。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案