mostly-ai/mostlyai

Synthetic Data SDK ✨

What it solves

它解决了在保持隐私的前提下,获取高保真数据用于分析和测试的挑战。它允许用户创建表格或语言数据集的合成版本,保留原始数据的统计特性,同时不暴露敏感信息。

How it works

SDK 提供编程接口,以在现有数据资产上训练“Generators”。这些生成器使用各种模型——例如用于表格数据的 TabularARGN、用于图关系的 DNN,以及微调的 Hugging Face 模型或 LSTM 用于文本——来学习数据的底层模式。训练完成后,这些生成器可用于生成合成数据集、抽取特定代表样本,或基于固定列值执行条件模拟。

Who it’s for

它面向需要隐私安全数据集进行机器学习、软件测试或数据共享的数据科学家和开发者,并且希望能够在本地计算或通过远程端点灵活运行这些过程。

Highlights

  • Broad Data Support: 处理混合类型数据(分类、数值、地理空间、文本)、多表结构和时间序列。
  • Flexible Deployment: 提供本地(LOCAL)模式用于本地计算,和客户端(CLIENT)模式用于远程端点。
  • Advanced Synthesis: 支持上采样、条件模拟、重新平衡少数群体,以及统计公平性控制。
  • Quality Assurance: 包含自动化质量指标用于衡量保真度和隐私,并提供详细的 HTML 报告进行可视化分析。
  • Integration: 内置连接器支持多种数据库和云存储(例如 Snowflake、Postgres、BigQuery)。