meta-pytorch/data

A PyTorch repo for data loading and utilities to be shared by the PyTorch domain libraries.

What it solves

TorchDataは、PyTorchに対してスケーラブルでパフォーマンスの高いデータロード解決策を提供し、より優れた状態管理と柔軟なデータ前処理パイプラインのニーズに対応します。

How it works

これは、主に2つのコンポーネントを通じて標準的なPyTorchのDataLoaderDatasetを強化します:

  • StatefulDataLoader: 標準的なDataLoaderのドロップインリプレースメントであり、state_dictおよびload_state_dictメソッドを追加します。これにより、ユーザーはカスタムのイテレーション進捗やRNG状態の追跡を含む、エポックの途中からのチェックポイントからトレーニングを保存および再開することが可能になります。
  • torchdata.nodes: ストリーミングプログラミングモデルを使用して、一般的なデータロードおよび前処理操作を連鎖的に組み合わせることができる、構成可能なイテレータのライブラリです。

Who it’s for

大規模なデータセットを扱い、トレーニングを中断した場所から正確に再開できることを保証する必要がある、PyTorchを使用している機械学習エンジニアおよび研究者。

Highlights

  • Mid-epoch checkpointing: データローダーの正確な状態を保存および復元することを可能にします。
  • Composable iterators: 前処理ステップを連鎖させるためのストリーミングモデルを提供します。
  • Drop-in replacement: StatefulDataLoaderは、既存のPyTorchワークフローに簡単に統合できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト