mlcommons/inference
Reference implementations of MLPerf® inference benchmarks
What it solves
MLPerf Inference 是为衡量 AI 系统性能的标准化基准测试套件。它通过提供一致的模型、数据集与部署场景(如边缘与数据中心),解决了解析性能报告不一致的问题,藉此评估系统在真实环境下的推理速度。
How it works
该套件为各种不同模态的 AI 模型提供参考实现,包括文本(如 Llama 3.1, DeepSeek-R1, BERT)、图像(ResNet, YOLO, Stable Diffusion XL)、视频(Wan2.2)、音频(Whisper)以及多模态(Qwen3-VL)。它允许用户在自己的硬件与软件栈进行推理,使用各种框架(PyTorch, TensorFlow, ONNX, TVM)来衡量速度与准确性。
Who it’s for
硬件与软件开发者、AI 研究员、以及系统架构师,他们需要客观地比较不同硬件类别(边缘 vs. 数据中心)下 AI 推理引擎、加速器与部署框架的性能。
Highlights
- Broad Model Coverage: 支持广泛的模型范围,包括 LLMs, VLMs, text-to-video, 以及推荐系统 (DLRM)。
- Standardized Scenarios: 区分“边缘”与“数据中心”部署类别,以反映不同的硬件约束。
- Flexible Frameworks: 虽然提供参考实现,但提交者可以使用自己的框架来优化性能。
- Standardized Scenarios: 区分“边缘”与“数据中心”部署类别,以反映不同的硬件约束。
- Multi-modal Benchmarking: 涵盖从视觉、语言、语音转文本到图神经网络与 RAG (Retrieval-Augmented Generation) 系统。
相关
- 项目
- 项目
- 项目
- 项目
- 项目