mlcommons/inference
Reference implementations of MLPerf® inference benchmarks
What it solves
MLPerf Inference는 AI 시스템의 성능을 측정하기 위해 설계된 표준화된 벤치마크 스위트입니다. 일관된 모델, 데이터셋 및 배포 시나리오(예: 에지 및 데이터 센터)를 제공하여 시스템이 실제 환경에서 AI 모델을 얼마나 빠르게 실행할 수 있는지 평가함으로써 성능 보고의 불일치 문제를 해결합니다.
How it works
이 스위트는 다양한 모달리티의 광범위한 AI 모델에 대해 참조 구현을 제공합니다. 여기에는 텍스트(Llama 3.1, DeepSeek-R1, BERT), 이미지(ResNet, YOLO, Stable Diffusion XL), 비디오(Wan2.2), 오디오(Whisper), 그리고 멀티모달(Qwen3-VL)이 포함됩니다. 사용자는 다양한 프레임워크(PyTorch, TensorFlow, ONNX, TVM)를 사용하여 자신의 하드웨어 및 소프트웨어 스택에서 이러한 모델을 실행하여 속도와 정확도를 측정할 수 있습니다.
Who it’s for
다양한 하드웨어 카테고리(에지 vs. 데이터 센터)에서 AI 추론 엔진, 가속기 및 배포 프레임워크의 성능을 객관적으로 비교해야 하는 하드웨어 및 소프트웨어 개발자, AI 연구자 및 시스템 아키텍트.
Highlights
- Broad Model Coverage: LLMs, VLMs, text-to-video, 그리고 추천 시스템(DLRM)을 포함한 방대한 모델 범위를 지원합니다.
- Standardized Scenarios: 서로 다른 하드웨어 제약 조건을 반영하기 위해 "에지"와 "데이터 센터" 배포 카테고리를 구분합니다.
- Flexible Frameworks: 참조 구현이 제공되지만, 제출자는 자신의 프레임워크를 사용하여 성능을 최적화할 수 있습니다.
- Multi-modal Benchmarking: 비전, 언어, 음성-텍스트 변환부터 그래프 신경망 및 RAG (Retrieval-Augmented Generation) 시스템까지 모든 것을 다룹니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트