meta-pytorch/data
A PyTorch repo for data loading and utilities to be shared by the PyTorch domain libraries.
它解决了什么问题
TorchData 为 PyTorch 提供了可扩展且高性能的数据加载解决方案,解决了更好的状态管理以及灵活的数据预处理流水线的需求。
它如何工作
它通过两个主要组件增强了标准的 PyTorch DataLoader 和 Dataset:
- StatefulDataLoader:标准 DataLoader 的即插即用替代品,增加了
state_dict和load_state_dict方法,允许用户保存和从中断的 epoch 恢复训练,包括跟踪自定义迭代进度和随机数生成器(RNG)状态。 - torchdata.nodes:一组可组合的迭代器,允许用户使用流式编程模型串联常见的数据加载和预处理操作。
适用于谁
使用 PyTorch 的机器学习工程师和研究人员,需要处理大型数据集,并确保训练可以精确地从中断处恢复。
主要特性
- epoch 中断点保存:支持保存和恢复数据加载器的精确状态。
- 可组合的迭代器:提供流式模型以串联预处理步骤。
- 即插即用替代品:
StatefulDataLoader可轻松集成到现有的 PyTorch 工作流中。
相关
- 项目
- 项目
- 项目
- 项目
- 项目