sdv-dev/SDV

Synthetic data generation for tabular data

What it solves

SDV 提供一个完整的工具箱,用于创建高质量的表格合成数据。它解决了在测试或分析时需要真实感数据却不想泄露敏感信息的问题,让用户能够在匿名化的前提下共享或使用数据。

How it works

该库使用各种机器学习算法学习真实数据集中的统计模式、相关性和关系,然后模拟这些模式生成新的合成数据行。它支持多种建模方法,从传统统计方法(如 Gaussian Copulas)到深度学习模型(如 CTGAN)。

Who it’s for

数据科学家和开发者,需要为单表、多表关联或序列数据生成合成版本,以用于软件测试、研究或隐私保护的数据共享。

Highlights

  • Diverse Modeling Options: 支持统计模型和深度学习模型两种数据合成方式。
  • Privacy-Focused: 包含匿名化敏感列的工具,并可将业务规则定义为逻辑约束。
  • Comprehensive Evaluation: 内置工具可使用质量报告和可视化方式比较合成数据与真实数据。
  • Flexible Data Structures: 能合成单表、多表关系数据库,以及序列/时间序列数据。