sdv-dev/SDGym
Benchmarking synthetic data generation methods.
What it solves
標準化された方法で、異なる合成データ生成手法を比較できるようにします。モデルを手動でテストする代わりに、古典的統計からディープラーニングまで、さまざまなモデリングアプローチのパフォーマンス、メモリ使用量、データ品質をベンチマークし、特定のデータに最も効果的な手法を判断できます。
How it works
SDGym は Synthetic Data Vault(SDV)エコシステムと統合されたベンチマークフレームワークです。ユーザーは SDV ライブラリ、組み込みベースライン、またはカスタム機械学習モデルから合成器(synthesizer)を選択し、公開データセットまたはプライベートデータセットに対して実行できます。フレームワークはパフォーマンス、メモリ消費、品質/プライバシー指標に基づいてこれらのモデルを評価します。
Who it’s for
高品質な合成データを生成し、さまざまな生成モデルを客観的に比較して、効率と精度のベストバランスを見つけたいデータサイエンティストや ML エンジニア向けです。
Highlights
- Flexible Synthesizer Support: SDV の synthesizer、基本ベースライン、ユーザー定義のトレーニング・サンプリングロジックに対応。
- Dataset Integration: 公開データセットのライブラリを含み、ローカルまたは Amazon S3 バケットに保存されたカスタムデータもサポート。
- Comprehensive Metrics: 出力品質とプライバシーだけでなく、パフォーマンスとメモリ使用量という計算コストも測定。
- SDV Ecosystem: Synthetic Data Vault プロジェクト全体とシームレスに統合され、データ生成と評価が容易に行えます。