ai-dynamo/aiperf

AIPerf is a comprehensive benchmarking tool that measures the performance of generative AI models served by your preferred inference solution.

解决的问题

AIPerf 是一款旨在测量各种推理解决方案中生成式 AI 模型性能的基准测试工具。它能帮助开发人员和研究人员确定其模型部署的准确性能特征,例如延迟、吞吐量以及系统处理不同负载模式的方式。

工作原理

AIPerf 使用可扩展的多进程架构,通过 ZMQ 与 10 个服务进行通信以模拟用户流量。可以通过 CLI 标志或 YAML 文件进行配置,向支持的 API(包括与 OpenAI 兼容的端点、NIM 和 Hugging Face TGI)发送请求。它支持多种基准测试模式,包括固定并发、请求速率控制以及实际生产追踪的重放(例如来自 SageMaker 或 Baseten)。

适用对象

它适用于需要在生产部署前或部署期间,对 LLM、图像、音频和视频生成端点的性能和可扩展性进行严格测试的 AI 工程师、ML Ops 专业人员和研究人员。

亮点

  • 全面的指标:跟踪首字延迟 (TTFT)、Token 间延迟 (ITL) 和整体请求吞吐量。
  • 语言与多模态支持:基准测试文本 LLM、嵌入、排序、音频、图像生成和视频生成。
  • 高级负载控制:支持 Poisson 和 gamma 流量到达模式、逐渐升温和预热阶段,以消除冷启动效应。
  • 生产追踪重放:能够重放来自公开数据集 (ShareGPT) 或生产日志的确定性工作负载。
  • 遥测集成:与 MLflow、OpenTelemetry 和 Weights & Biases 集成,用于实时指标流和结果上传。
  • 可扩展架构:具有用于自定义端点、数据集和指标的插件系统。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目