NVIDIA/nvidia-resiliency-ext
NVIDIA Resiliency Extension is a python package for framework developers and users to implement fault-tolerant features. It improves the effective training time by minimizing the downtime due to failures and interruptions.
解決する課題
NVIDIA Resiliency Extension (NVRx) は、大規模な AI トレーニング中の生産性維持という課題に取り組みます。ハードウェアやソフトウェアの障害が発生した際にトレーニングの完全な失敗を防ぎ、同じ障害発生ポイントまでの進行状況の損失を最小限に抑えます。
仕組み
NVRx は、PyTorch ベースのワークロード向けに、障害を自動的に処理するためのモジュラー式ツールセットを提供します。システム全体のヘルスチェックと障害検出を使用して、効率を妨げるハングしたランクや遅い「ストラグラー」(GPU/CPU のパフォーマンスの問題)を特定します。障害が検出されると、計算ノードの再割り当てを必要とせずに、プロセス内でのトレーニングの再起動を可能にします。また、非同期およびローカルのチェックポイント用フレームワークを提供し、トレーニング プロセスを遅延させることなく、頻繁かつ効率的に進行状況を保存します。
対象者
大規模な AI トレーニングに取り組む研究者や開発者、特に PyTorch、PyTorch Lightning、または NVIDIA NeMo を使用しており、トレーニングの実行が安定し、ハードウェア障害に対する耐性を持つことを確保する必要がある方々。
ハイライト
- 自動再起動: ジョブ内でトレーニングを再起動し、SLURM ノードの再割り当ての必要性を回避します。
- 障害およびストラグラー検出: GPU と CPU のパフォーマンスを監視し、ハングしたランクや遅いノードを特定します。
- 効率的なチェックポイント: 非同期およびローカルのチェックポイントの両方をサポートし、作業の損失を減らします。
- フレームワークの統合: PyTorch Lightning や NVIDIA NeMo とシームレスに統合します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト