ai-dynamo/aiperf

AIPerf is a comprehensive benchmarking tool that measures the performance of generative AI models served by your preferred inference solution.

解決的問題

AIPerf 是一款旨在測量各種推理解決方案中生成式 AI 模型性能的基準測試工具。它能幫助開發人員和研究人員確定其模型部署的準確性能特徵,例如延遲、吞吐量以及系統處理不同負載模式的方式。

工作原理

AIPerf 使用可擴展的多進程架構,透過 ZMQ 與 10 個服務進行通訊以模擬用戶流量。可以透過 CLI 旗標或 YAML 檔案進行配置,向支援的 API(包括與 OpenAI 相容的端點、NIM 和 Hugging Face TGI)發送請求。它支援多種基準測試模式,包括固定並發、請求速率控制以及實際生產追蹤的重放(例如來自 SageMaker 或 Baseten)。

適用對象

它適用於需要在生產部署前或部署期間,對 LLM、圖像、音訊和影片生成端點的性能與可擴展性進行嚴格測試的 AI 工程師、ML Ops 專業人員和研究人員。

亮點

  • 全面的指標:追蹤首字延遲 (TTFT)、Token 間延遲 (ITL) 和整體請求吞吐量。
  • 語言與多模態支援:基準測試文本 LLM、嵌入、排序、音訊、圖像生成和影片生成。
  • 進階負載控制:支援 Poisson 和 gamma 流量到達模式、逐漸升溫和預熱階段,以消除冷啟動效應。
  • 生產追蹤重放:能夠重放來自公開數據集 (ShareGPT) 或生產日誌的確定性工作負載。
  • 遙測整合:與 MLflow、OpenTelemetry 和 Weights & Biases 整合,用於即時指標串流和結果上傳。
  • 可擴展架構:具有用於自定義端點、數據集和指標的插件系統。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案