NVIDIA/Megatron-Energon
Megatron's multi-modal data loader
何を解決するか
Megatron Energonは、大規模モデル向けの膨大なマルチモーダル学習データの読み込みと管理という課題に対処します。さまざまなデータセットを統合し、大規模なクラスタのノードとプロセスにわたってデータ読み込みを分散するプロセスを簡素化しながら、再現性と再開可能性を維持します。
動作方法
Energonは、Megatron-LMフレームワークの一部として、またはスタンドアロンのPythonパッケージとして使用できるマルチモーダルデータローダーです。WebDatasetおよびJSONL形式をサポートしています。ユーザーはコマンドラインツール(energon)を使用してデータセットを準備・検証し、システムとの互換性を確認できます。準備が完了すると、get_train_datasetやget_loaderといった関数が提供され、トレーニングループにデータを供給できます。
対象ユーザー
大規模なマルチモーダルモデルをトレーニングする研究者やエンジニア向けです。さまざまな種類のデータサンプルと処理を扱えるスケーラブルで分散型のデータパイプラインが必要な方々に最適です。
主な特徴
- クラスタスケールの分散: 複数のノードとプロセスにわたってデータ読み込み作業を効率的に分散します。
- マルチモーダル対応: 異なる種類のデータサンプルを処理するように特別に設計されています。
- データセットのブレンド: 複数の異なるデータセットを混合・統合する機能があります。
- 信頼性: トレーニング実行が再現可能であり、中断した場所から再開できるように保証します。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト