Data-Centric-AI-Community/fg-data-synthetic
Synthetic data generators for tabular and time-series data
What it solves
このプロジェクトは、合成テーブルデータおよび時系列データを生成する方法を提供します。これは、データを共有する際のプライバシーコンプライアンスの確保、バイアスの除去、データセットのバランス調整、および実世界の識別可能な情報を使用せずに既存のデータセットを拡張するために役立ちます。
How it works
このライブラリは、さまざまな生成モデルを使用して、実データの統計的特性を複製- 複製します。テーブルデータについては、CTGAN、CGAN、WGAN、および Gaussian Mixture モデル(GPU なしでも高速生成が可能)を使用します。時系列データについては、TimeGAN や DoppelGANger を使用します。すべてのディープラーニングモデルは TensorFlow 2.0 を使用して実装されています。
Who it's for
開発、テスト、またはプライバシー保護のためのデータ共有が必要なデータサイエンティストや機械学習エンジニア。
Highlights
- Low-code UI: Streamlit ベースのアプリケーションにより、ユーザーは UI を通じて合成器モデルをトレーニングし、合成データサンプルの生成/プロファイリングを行えます。
- Diverse Model Support: 幅広い GAN 架构 (e.g., CTGAN, WGAN-GP, DRAGAN) および Gaussian Mixture モデルを使用可能です。
- GPU-optional: Gaussian Mixture モデルは、GPU を必要とせずに合成データ生成を高速に行うことができます。
- Time-Series Capability: 時系列データ生成のための TimeGAN や DoppelGANger を使用したシーケンシャルデータ生成の専用サポート。