open-gigaai/giga-datasets

GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization

解决的问题

GigaDatasets 提供了一个统一且轻量的框架,用于管理人工智能训练和推理中使用的大型数据集。它简化了数据整理、打包、加载和评估的复杂过程,确保在不同数据格式和结构之间保持一致性。

如何工作

该框架通过一系列针对数据流水线不同阶段的专用工具运行:

  • 数据打包:使用 Writer 类(如 PklWriterFileWriterLmdbWriter)将非结构化的原始数据(如图像和 JSON 注释)转换为结构化、高效的格式。
  • 数据加载:通过单一的 load_dataset 函数,用户可以忽略底层存储格式,加载数据集。
  • 数据评估FIDEvaluator 提供了一种简化的方式,用于将预测结果与数据集进行对比评估。
  • 可扩展性:系统设计支持用户轻松添加新数据字段(例如,向现有数据集添加 Canny 图像),以适应不同模型的需求。

适用人群

专为处理大规模多模态数据的 AI 研究人员和开发者设计,包括图像、视频、2D/3D 框、2D/3D 点,以及使用 LeRobot 数据集的用户。

主要亮点

  • 统一工作流:将整理、打包、加载和评估整合到一个系统中。
  • 多格式支持:兼容 File、LMDB、Pickle 和 LeRobot 数据集。
  • 高性能:在大规模处理过程中优化了速度和内存效率。
  • 简单 API:仅需一行代码即可完成数据集的加载和评估。

相关

  • 项目
  • 项目
  • 项目
  • 项目