NVIDIA/Megatron-Energon

Megatron's multi-modal data loader

何を解決するか

Megatron Energonは、大規模モデル向けの膨大なマルチモーダル学習データの読み込みと管理という課題に対処します。さまざまなデータセットを統合し、大規模なクラスタのノードとプロセスにわたってデータ読み込みを分散するプロセスを簡素化しながら、再現性と再開可能性を維持します。

動作方法

Energonは、Megatron-LMフレームワークの一部として、またはスタンドアロンのPythonパッケージとして使用できるマルチモーダルデータローダーです。WebDatasetおよびJSONL形式をサポートしています。ユーザーはコマンドラインツール(energon)を使用してデータセットを準備・検証し、システムとの互換性を確認できます。準備が完了すると、get_train_datasetget_loaderといった関数が提供され、トレーニングループにデータを供給できます。

対象ユーザー

大規模なマルチモーダルモデルをトレーニングする研究者やエンジニア向けです。さまざまな種類のデータサンプルと処理を扱えるスケーラブルで分散型のデータパイプラインが必要な方々に最適です。

主な特徴

  • クラスタスケールの分散: 複数のノードとプロセスにわたってデータ読み込み作業を効率的に分散します。
  • マルチモーダル対応: 異なる種類のデータサンプルを処理するように特別に設計されています。
  • データセットのブレンド: 複数の異なるデータセットを混合・統合する機能があります。
  • 信頼性: トレーニング実行が再現可能であり、中断した場所から再開できるように保証します。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト