open-gigaai/giga-datasets
GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization
解决的问题
GigaDatasets 提供了一个统一且轻量的框架,用于管理人工智能训练和推理中使用的大型数据集。它简化了数据整理、打包、加载和评估的复杂过程,确保在不同数据格式和结构之间保持一致性。
如何工作
该框架通过一系列针对数据流水线不同阶段的专用工具运行:
- 数据打包:使用 Writer 类(如
PklWriter、FileWriter和LmdbWriter)将非结构化的原始数据(如图像和 JSON 注释)转换为结构化、高效的格式。 - 数据加载:通过单一的
load_dataset函数,用户可以忽略底层存储格式,加载数据集。 - 数据评估:
FIDEvaluator提供了一种简化的方式,用于将预测结果与数据集进行对比评估。 - 可扩展性:系统设计支持用户轻松添加新数据字段(例如,向现有数据集添加 Canny 图像),以适应不同模型的需求。
适用人群
专为处理大规模多模态数据的 AI 研究人员和开发者设计,包括图像、视频、2D/3D 框、2D/3D 点,以及使用 LeRobot 数据集的用户。
主要亮点
- 统一工作流:将整理、打包、加载和评估整合到一个系统中。
- 多格式支持:兼容 File、LMDB、Pickle 和 LeRobot 数据集。
- 高性能:在大规模处理过程中优化了速度和内存效率。
- 简单 API:仅需一行代码即可完成数据集的加载和评估。
相关
- 项目
- 项目
- 项目
- 项目