mostly-ai/mostlyai

Synthetic Data SDK ✨

解决的问题

解决在保持隐私的前提下获取高保真数据用于分析和开发的挑战。允许用户创建表格式或语言数据集的合成版本,保留原始数据的统计特性,同时不暴露敏感信息。

工作原理

该SDK提供了一个编程接口,用于在现有数据资产上训练“生成器”。这些生成器使用各种模型——如用于表格式数据的 TabularARGN、用于图关系的 DNN,以及用于文本的微调 Hugging Face 模型或 LSTMs——来学习数据的底层模式。训练完成后,这些生成器可用于创建合成数据集、探测特定代表性样本,或基于固定列值执行条件模拟。

适用人群

专为需要隐私安全数据集进行测试、训练机器学习模型,或在不损害安全性的前提下跨组织共享数据的数据科学家和开发者设计。

主要亮点

  • 广泛的数据支持:支持混合类型数据(分类、数值、地理空间、文本)、多表结构和时间序列。
  • 灵活的部署方式:提供 LOCAL 模式用于本地计算,以及 CLIENT 模式用于远程端点。
  • 高级采样功能:支持过采样、条件模拟、对代表性不足的子集进行再平衡,以及统计公平性控制。
  • 质量保障:包含自动化的保真度和隐私质量指标,提供详细的 HTML 报告以供可视化分析。
  • 丰富的集成能力:可连接多种数据源,包括 BigQuery、Snowflake、PostgreSQL、MySQL 和 Oracle。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目