Data-Centric-AI-Community/fg-data-synthetic
Synthetic data generators for tabular and time-series data
What it solves
이 프로젝트는 합성 테이블 및 시계열 데이터를 생성하는 방법을 제공합니다. 이는 데이터를 공유할 때 개인정보 보호 규정을 준수하고, 편향을 제거하며, 데이터셋의 균형을 맞추고, 실제 세계의 식별 가능한 정보를 사용하지 않고 기존 데이터셋을 확장하는 데 유용합니다.
How it works
이 라이브러리는 다양한 생성 모델을 사용하여 실제 데이터의 통계적 특성을 복토제합니다. 테이블 데이터의 경우, CTGAN, CGAN, WGAN 및 Gaussian Mixture 모델(GPU 없이도 빠른 생성이 가능합니다)을 사용합니다. 시계열 또는 순차적 데이터의 경우, TimeGAN 및 DoppelGANger를 사용합니다. 모든 딥러닝 모델은 TensorFlow 2.0을 사용하여 구현되었습니다. \n## Highlights
- Low-code UI: 사용자가 인터페이스를 통해 합성기 모델을 학습시키고 합성 데이터 샘플을 생성/프로파일링할 수 있는 Streamlit 기반 애플리케이션입니다.
- Diverse Model Support: 다양한 GAN 아키텍처(예: CTGAN, WGAN-GP, DRAGAN)를 포함합니다.
- GPU-optional: Gaussian Mixture 모델은 GPU 없이도 합성 데이터 생성을 빠르게 시작할 수 있는 옵션을 제공합니다.
- Time-Series Capability: 시계열 데이터 생성을 위해 TimeGAN 및 DoppelGANger를 사용한 순차적 데이터 생성에 대한 전용 지원을 제공합니다.