sdv-dev/SDGym

Benchmarking synthetic data generation methods.

What it solves

它提供了一套标准化的方法来比较不同的合成数据生成技术。用户无需手动测试模型,而是可以在各种建模方法(从传统统计到深度学习)之间,基准测试性能、内存使用和数据质量,以确定哪种方法最适合其特定数据。

How it works

SDGym 作为一个基准框架,与 Synthetic Data Vault(SDV)生态系统集成。它允许用户选择一组 synthesizer(可以是 SDV 库中的、内置基线或自定义的机器学习模型),并在各种数据集(公开或私有)上运行。框架随后根据性能、内存消耗和质量/隐私指标评估这些模型。

Who it’s for

数据科学家和 ML 工程师,需要生成高质量的合成数据,并希望客观比较不同的生成模型,以找到效率与准确性的最佳平衡。

Highlights

  • Flexible Synthesizer Support: 兼容 SDV synthesizer、基本基线以及用户自定义的训练和采样逻辑。
  • Dataset Integration: 包含公共数据集库,并支持本地或 Amazon S3 桶中的自定义数据。
  • Comprehensive Metrics: 不仅衡量输出质量和隐私,还衡量性能和内存使用等计算成本。
  • SDV Ecosystem: 完全整合到 Synthetic Data Vault 项目中,实现无缝的数据生成和评估。