Data-Centric-AI-Community/fg-data-synthetic

Synthetic data generators for tabular and time-series data

What it solves

這個專案提供了一種生成合成表格與時間序列數據的方法。這對於在共享數據時確保隱私合規、消除偏差、平衡數據集,以及在不使用真實世界可識別資訊的情況下擴充現有數據集非常有用。

How it works

此函式庫利用各種生成式模型來複製真實數據的統計特性。對於表格數據,它使用 CTGAN、CGAN、WGAN 和 Gaussian Mixture 模型(這允許在沒有 GPU 的情況下進行快速生成)。對於序列或時間序列數據,它使用 TimeGAN 和 DoppelGANger 等模型。所有深度學習模型都是使用 TensorFlow 2.0 實作的。

Who it's for

需要高品質合成數據集進行開發、測試或隱私保護數據共享的數據科學家和機器學習工程師。

Highlights

  • Low-code UI: 一個基於 Streamlit 的應用程式,允許用戶透過使用者介面訓練合成器模型並生成/分析合成數據樣本。
  • Diverse Model Support: 包括廣泛的 GAN 架構(例如 CTGAN、WGAN-GP、DRAGAN)和 Gaussian Mixture 模型。
  • GPU-optional: Gaussian Mixture 模型提供了一個無需 GPU 即可快速開始合成數據生成的選項。
  • Time-Series Capability: 針對使用 TimeGAN 和 DoppelGANger 的序列數據生成提供專用支持。