Data-Centric-AI-Community/fg-data-synthetic

Synthetic data generators for tabular and time-series data

What it solves

このプロジェクトは、合成テーブルデータおよび時系列データを生成する方法を提供します。これは、データを共有する際のプライバシーコンプライアンスの確保、バイアスの除去、データセットのバランス調整、および実世界の識別可能な情報を使用せずに既存のデータセットを拡張するために役立ちます。

How it works

このライブラリは、さまざまな生成モデルを使用して、実データの統計的特性を複製- 複製します。テーブルデータについては、CTGAN、CGAN、WGAN、および Gaussian Mixture モデル(GPU なしでも高速生成が可能)を使用します。時系列データについては、TimeGAN や DoppelGANger を使用します。すべてのディープラーニングモデルは TensorFlow 2.0 を使用して実装されています。

Who it's for

開発、テスト、またはプライバシー保護のためのデータ共有が必要なデータサイエンティストや機械学習エンジニア。

Highlights

  • Low-code UI: Streamlit ベースのアプリケーションにより、ユーザーは UI を通じて合成器モデルをトレーニングし、合成データサンプルの生成/プロファイリングを行えます。
  • Diverse Model Support: 幅広い GAN 架构 (e.g., CTGAN, WGAN-GP, DRAGAN) および Gaussian Mixture モデルを使用可能です。
  • GPU-optional: Gaussian Mixture モデルは、GPU を必要とせずに合成データ生成を高速に行うことができます。
  • Time-Series Capability: 時系列データ生成のための TimeGAN や DoppelGANger を使用したシーケンシャルデータ生成の専用サポート。