mostly-ai/mostlyai
Synthetic Data SDK ✨
What it solves
它解決了在保持隱私的前提下,取得高保真資料以進行分析與測試的挑戰。它允許使用者產生表格或語言資料集的合成版本,保留原始資料的統計特性,同時不洩露敏感資訊。
How it works
SDK 提供程式化介面,讓使用者在現有資料資產上訓練「Generators」。這些生成器使用各種模型——例如用於表格資料的 TabularARGN、用於圖關係的 DNN,以及微調的 Hugging Face 模型或 LSTM 用於文字——以學習資料的底層模式。訓練完成後,這些生成器可用於產生合成資料集、抽取特定代表樣本,或根據固定欄位值執行條件模擬。
Who it’s for
此 SDK 針對需要隱私安全資料集以進行機器學習、軟體測試或資料共享的資料科學家與開發者設計,且希望能彈性地在本地計算環境或遠端端點上執行這些流程。
Highlights
- Broad Data Support: 處理混合類型資料(類別、數值、地理空間、文字)、多表結構與時間序列。
- Flexible Deployment: 提供本地(LOCAL)模式供內部計算,及遠端(CLIENT)模式供遠端端點使用。
- Advanced Synthesis: 支援上抽樣、條件模擬、重新平衡少數族群,以及統計公平性控制。
- Quality Assurance: 包含自動化的品質指標以衡量保真度與隱私,並提供詳細的 HTML 報告供視覺分析。
- Integration: 內建連接器支援多種資料庫與雲端儲存(例如 Snowflake、Postgres、BigQuery)。