mlcommons/inference

Reference implementations of MLPerf® inference benchmarks

What it solves

MLPerf Inference は、AI システムの性能を測定するために設計された標準化されたベンチマークスイートです。一貫性のあるモデル、データセット、およびデプロイメントシナリオ(エッジとデータセンターなど)を提供することで、性能報告の不一致という問題を解決し、システムが現実世界の環境で AI モデルをどれだけ速く実行できるかを評価します。

How it works

このスイートは、さまざまなモダリティの幅広い AI モデルに対して、リファレンス実装を提供します。これには、テキスト(Llama 3.1, DeepSeek-R1, BERT)、画像(ResNet, YOLO, Stable Diffusion XL)、動画(Wan2.2)、音声(Whisper)、およびマルチモーダル(Qwen3-VL)が含まれます。 ユーザーは、さまざまなフレームワーク(PyTorch, TensorFlow, ONNX, TVM)を使用して、自身のハードウェアおよびソフトウェアスタック上でこれらのモデルを実行し、速度と精度を測定することができます。

Who it’s for

ハードウェアおよびソフトウェアの開発者、AI 研究者、およびシステムアーキテクト。異なるハードウェアカテゴリ(エッジ vs. データセンター)において、AI 推論エンジン、アクセラレータ、およびデプロイメントフレームワークの性能を客観的に比較する必要があります。

Highlights

  • Broad Model Coverage: LLMs, VLMs, text-to-video, および推奨システム (DLRM) を含む、膨大なモデルの範囲をサポートしています。
  • Standardized Scenarios: 「エッジ」と「データセンター」のデプロイメントカテゴリを区別し、異なるハードウェアの制約を反映しています。
  • Flexible Frameworks: リファレンス実装が提供される一方で、提出者は独自のフレームワークを使用して性能を最適化できます。
  • Multi-modal Benchmarking: ビジョン、言語、音声からテキストへの変換、グラフニューラルネットワーク、および RAG (Retrieval-Augmented Generation) システムまで、あらゆるものをカバーしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト