mostly-ai/mostlyai

Synthetic Data SDK ✨

解決的問題

解決在維持隱私的前提下取得高保真數據以供分析與開發的挑戰。允許使用者建立表格式或語言資料集的合成版本,保留原始資料的統計特性,同時不暴露敏感資訊。

運作方式

SDK 提供程式介面,可在現有資料資產上訓練「產生器」。這些產生器使用各種模型——例如用於表格式資料的 TabularARGN、用於圖關係的 DNN,以及用於文字的微調 Hugging Face 模型或 LSTMs——來學習資料的底層模式。訓練完成後,這些產生器可用於建立合成資料集、探測特定代表性樣本,或根據固定欄位值執行條件模擬。

適用對象

專為需要隱私安全資料集進行測試、訓練機器學習模型,或在不損害安全性的前提下跨組織共享資料的資料科學家與開發者設計。

主要亮點

  • 廣泛的資料支援:支援混合型資料(分類、數值、地理空間、文字)、多表結構與時間序列。
  • 彈性的部署方式:提供 LOCAL 模式用於本地運算,以及 CLIENT 模式用於遠端端點。
  • 高階取樣功能:支援過取樣、條件模擬、對代表性不足的子集進行再平衡,以及統計公平性控制。
  • 品質保障:包含自動化的保真度與隱私品質指標,提供詳細的 HTML 報告以供視覺化分析。
  • 豐富的整合能力:可連接多種資料來源,包括 BigQuery、Snowflake、PostgreSQL、MySQL 與 Oracle。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案