Data-Centric-AI-Community/fg-data-synthetic

Synthetic data generators for tabular and time-series data

What it solves

本项目提供了一种生成合成表格和时间序列数据的方法。这对于在共享数据时确保隐私合规、正在消除偏差、平衡数据集,以及在不使用真实世界可识别信息的情况下扩充现有数据集非常有用。

How it works

该库利用各种生成式模型来复制真实数据的统计特性。对于表格数据,它使用 CTGAN、CGAN、WGAN 和 Gaussian Mixture 模型(这允许在没有 GPU 的情况下进行快速生成)。对于序列或时间序列数据,它使用 TimeGAN 和 DoppelGANger 模型。所有深度学习模型都是使用 TensorFlow 2.0 实现的。

Who it's for

需要高质量合成数据集进行开发、测试或隐私保护数据共享的数据科学家和机器学习工程师。

Highlights

  • Low-code UI: 一个基于 Streamlit 的应用程序,允许用户通过用户界面训练合成器模型并生成/分析合成数据样本。
  • Diverse Model Support: 包括广泛的 GAN 架构(例如 CTGAN、WGAN-GP、DRAGAN)和 Gaussian Mixture 模型。
  • GPU-optional: Gaussian Mixture 模型提供了一个无需 GPU 即可快速开始合成数据生成的选项。
  • Time-Series Capability: 针对使用 TimeGAN 和 DoppelGANger 的序列数据生成提供专用支持。