sdv-dev/SDGym
Benchmarking synthetic data generation methods.
What it solves
它提供了一套標準化的方法來比較不同的合成資料生成技術。使用者不必手動測試模型,而是可以在各種建模方法(從傳統統計到深度學習)之間,基準測試效能、記憶體使用量與資料品質,以找出最適合其特定資料的方案。
How it works
SDGym 作為一個基準測試框架,與 Synthetic Data Vault(SDV)生態系統整合。它允許使用者選取一組 synthesizer(可來自 SDV 函式庫、內建基線或自行撰寫的機器學習模型),並在各種資料集(公開或私有)上執行。框架會根據效能、記憶體消耗與品質/隱私指標來評估這些模型。
Who it’s for
資料科學家與 ML 工程師,需產生高品質合成資料,並希望客觀比較不同生成模型,以找出效率與準確度的最佳平衡。
Highlights
- Flexible Synthesizer Support: 相容於 SDV synthesizer、基本基線,以及使用者自訂的訓練與抽樣邏輯。
- Dataset Integration: 包含公共資料集庫,並支援本機或 Amazon S3 bucket 中的自訂資料。
- Comprehensive Metrics: 不僅衡量輸出品質與隱私,亦測量效能與記憶體使用等計算成本。
- SDV Ecosystem: 完全整合於 Synthetic Data Vault 專案,提供無縫的資料生成與評估。