NVIDIA/DCGM

NVIDIA Data Center GPU Manager (DCGM) is a project for gathering telemetry and measuring the health of NVIDIA GPUs

何を解決するか

NVIDIA Data Center GPU Manager (DCGM) は、大規模なクラスタ環境におけるNVIDIA GPUの管理と監視の複雑さに対処します。信頼性と稼働率を確保するために、集中管理された方法でGPUの健全性監視、診断、リソースガバナンスを提供します。

動作方法

DCGMは、テレメトリを収集しGPUの状態を管理するデーモンとして動作します。アクティブな健全性監視と包括的な診断を提供するツールセットを備えています。インフラチーム向けのスタンドアロンツールとして使用できるほか、より大きなクラスタ管理およびリソーススケジューリングシステムに統合することも可能です。また、dcgm-exporter を通じてKubernetesエコシステムとも統合され、GPUのテレメトリを収集できます。

対象ユーザー

データセンターにおけるNVIDIA GPUクラスタを管理するインフラチームやシステム管理者、およびクラスタ管理ツールを開発する開発者。

主な特徴

  • 包括的な監視: アクティブな健全性監視とシステムアラートを含む。
  • ガバナンスポリシー: GPUの電力およびクロック設定を管理。
  • 診断機能: GPU健全性を検証するためのツールセットを提供。
  • 広範なプラットフォーム対応: x86_64、Arm、POWER (ppc64le) アーキテクチャのLinuxをサポート。
  • APIサポート: C、Python、Goでのライブラリおよびソース例を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト