sgl-project/genai-bench

Genai-bench is a powerful benchmark tool designed for comprehensive token-level performance evaluation of large language model (LLM) serving systems.

解决的问题

Genai-bench 为评估 LLM 服务系统的 token 级性能提供了一种统一的方法。它通过提供标准化的测量方式,消除了对碎片化工具的依赖,能够跨不同流量场景和并发级别,统一衡量吞吐量、延迟和错误率。

工作原理

该工具通过 CLI 运行,允许用户通过 API 向模型后端发起基准测试。支持文本到文本和文本到图像任务。基准测试运行完成后,会收集原始指标和日志,随后可将其处理为详细的 Excel 报告和可视化图表,用于性能分析。

适用人群

专为需要测量和优化模型部署系统性能的 LLM 服务基础设施开发者和工程师设计。

主要亮点

  • 实时 UI 仪表板:在基准测试运行期间,实时监控进度、日志和指标。
  • 全面的指标:追踪首次 token 延迟(TTFT)、端到端(E2E)延迟、每输出 token 时间(TPOT)、吞吐量和每秒请求数(RPS)。
  • 实验分析器:生成 Excel 报告和可自定义的图表网格,用于对比不同实验结果。
  • 多模态支持:支持对文本生成和图像生成 API 进行基准测试。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目