ai-dynamo/aiconfigurator

Offline optimization of your disaggregated Dynamo graph

解决的问题

为分散式LLM服务配置LLM部署非常复杂,因为用户必须在预填充和解码工作进程数量、并行性设置以及SLA目标(如首个令牌时间、每输出令牌时间)之间取得平衡,以在不牺牲延迟的前提下最大化吞吐量。

工作原理

AIConfigurator 使用特定硬件和框架的收集性能数据来建模LLM推理。它会搜索数千种潜在配置,根据用户的模型、GPU数量和GPU类型找到最优设置。它可以以多种模式运行:

  • 默认:比较聚合式与分散式部署,以找到最佳整体配置。
  • 推荐:作为采购工具,计算满足特定性能目标所需的最小GPU数量。
  • 生成:无需完整参数扫描,快速创建基本配置。
  • Exp:运行在YAML文件中定义的自定义实验。

适用人群

需要优化LLM服务部署的ML工程师和基础设施架构师,特别是使用Dynamo或llm-d以在满足严格延迟SLA的同时实现最高吞吐量的用户。

特色

  • 多后端支持:支持 trtllmvllmsglang
  • 自动搜索:评估数千种配置,以找到吞吐量与延迟之间的帕累托前沿。
  • 部署产物:生成适用于多种目标的配置文件,包括Dynamo清单、llm-d Helm/Kustomize以及FPM。
  • 采购规模建议:推荐满足特定请求速率和SLA所需的最小硬件配置。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目