mlcommons/inference

Reference implementations of MLPerf® inference benchmarks

What it solves

MLPerf Inference 是为衡量 AI 系统性能的标准化基准测试套件。它通过提供一致的模型、数据集与部署场景(如边缘与数据中心),解决了解析性能报告不一致的问题,藉此评估系统在真实环境下的推理速度。

How it works

该套件为各种不同模态的 AI 模型提供参考实现,包括文本(如 Llama 3.1, DeepSeek-R1, BERT)、图像(ResNet, YOLO, Stable Diffusion XL)、视频(Wan2.2)、音频(Whisper)以及多模态(Qwen3-VL)。它允许用户在自己的硬件与软件栈进行推理,使用各种框架(PyTorch, TensorFlow, ONNX, TVM)来衡量速度与准确性。

Who it’s for

硬件与软件开发者、AI 研究员、以及系统架构师,他们需要客观地比较不同硬件类别(边缘 vs. 数据中心)下 AI 推理引擎、加速器与部署框架的性能。

Highlights

  • Broad Model Coverage: 支持广泛的模型范围,包括 LLMs, VLMs, text-to-video, 以及推荐系统 (DLRM)。
  • Standardized Scenarios: 区分“边缘”与“数据中心”部署类别,以反映不同的硬件约束。
  • Flexible Frameworks: 虽然提供参考实现,但提交者可以使用自己的框架来优化性能。
  • Standardized Scenarios: 区分“边缘”与“数据中心”部署类别,以反映不同的硬件约束。
  • Multi-modal Benchmarking: 涵盖从视觉、语言、语音转文本到图神经网络与 RAG (Retrieval-Augmented Generation) 系统。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目