mlcommons/inference

Reference implementations of MLPerf® inference benchmarks

What it solves

MLPerf Inference 是為衡量 AI 系統效能而設計的標準化基準測試套件。它透過提供一致的模型、資料集與部署場景(例如邊緣運算與資料中心),解決了效能報告不一致的問題,藉此評估系統在真實環境中執行 AI 模型的速度。

How it works

該套件為各種不同模態的 AI 模型提供參考實作,包括文字(如 Llama 3.1, DeepSeek-R1, BERT)、影像(ResNet, YOLO, Stable Diffusion XL)、影片(Wan2.2)、音訊(Whisper)以及多模態(Qwen3-VL)。它允許使用者在自己的硬體與軟體堆疊上,使用各種框架(PyTorch, TensorFlow, ONNX, TVM)來衡量速度與準確度。

Who it’s for

硬體與軟體開發人員、AI 研究人員以及系統架構師,他們需要客觀地比較不同硬體類別(邊緣運算 vs. 資料中心)下 AI 推論引擎、加速器與部署框架的效能。

Highlights

  • Broad Model Coverage: 支持廣泛的模型範圍,包括 LLMs, VLMs, text-to-video, 以及推薦系統 (DLRM)。
  • Standardized Scenarios: 區分「邊緣運算」與「資料中心」部署類別,以反映不同的硬體限制。
  • Flexible Frameworks: 雖然提供參考實作,但提交者可以使用自己的框架來優化效能。
  • Multi-modal Benchmarking: 涵蓋從視覺、語言、語音轉文字到圖神經網路與 RAG (Retrieval-Augmented Generation) 系統。",

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案