sdv-dev/SDV

Synthetic data generation for tabular data

What it solves

SDV 提供一套完整的工具箱,用於建立高品質的表格合成資料。它解決了在測試或分析時需要真實感資料卻不想洩露敏感資訊的問題,讓使用者能在匿名化的前提下分享或使用資料。

How it works

此函式庫使用各種機器學習演算法來學習真實資料集中的統計模式、相關性與關係,然後模擬這些模式以產生新的合成資料列。它支援多種建模方法,從傳統的統計方法(如 Gaussian Copulas)到深度學習模型(如 CTGAN)。

Who it’s for

資料科學家與開發者,需為單一表格、多個關聯表格或序列資料產生合成版本,以用於軟體測試、研究或隱私保護的資料共享。

Highlights

  • Diverse Modeling Options: 支援統計模型與深度學習模型兩種資料合成方式。
  • Privacy-Focused: 包含匿名化敏感欄位的工具,並可將業務規則定義為邏輯限制。
  • Comprehensive Evaluation: 內建工具可使用品質報告與視覺化方式比較合成資料與真實資料。
  • Flexible Data Structures: 能合成單一表格、多表格關聯資料庫,以及序列/時間序列資料。