tabularis-ai/be_great

A novel approach for synthesizing tabular data using pretrained large language models

它解决了什么问题

GReaT(真实表格数据生成)是一个旨在创建高质量合成表格数据的框架。它解决了在测试、保护隐私的数据共享以及扩充小规模数据集时需要真实数据的问题,同时不泄露原始敏感信息。

它如何工作

该框架利用预训练的基于Transformer的语言模型(LLMs)将表格数据视为一系列标记序列。它可以以三种主要模式运行:

  1. 基于训练的生成:使用 fit() 在真实数据集上微调模型,然后通过 sample() 生成新样本。
  2. 模拟数据生成:可以在无需任何真实训练数据的情况下,从声明式模式(定义类型、范围和分布)生成合成行。
  3. 插补:可以根据学习到的分布填充现有数据集中的缺失值(NaN)。

为了优化性能,它支持 LoRA(低秩适应)以实现高效的微调,并提供“引导采样”功能,用于复杂特征集,以确保生成质量更高。

适用人群

需要合成表格数据以实现隐私安全的虚拟数据、测试用例、开发环境以及为下游机器学习任务扩充数据集的数据科学家、机器学习工程师和开发者。

主要特性

  • 条件生成:生成满足特定逻辑约束的数据(例如 age >= 30)。
  • 实时质量监控:在训练过程中使用 ColumnShapes 相似性跟踪合成质量。
  • 全面的评估套件:内置指标用于统计相似性、下游实用性(机器学习效率)和隐私保护(例如 k-匿名化、成员推断)。
  • 高效的微调:集成 LoRA,降低在消费级硬件上的内存占用和训练时间。
  • 灵活的基于模式的模拟:无需训练集即可从 JSON/YAML 模式创建真实数据。

一个强大的框架,能够利用预训练的Transformer语言模型生成高质量的合成表格数据,支持基于训练和基于模式的生成方式。 — @username

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目