tabularis-ai/be_great
A novel approach for synthesizing tabular data using pretrained large language models
它解决了什么问题
GReaT(真实表格数据生成)是一个旨在创建高质量合成表格数据的框架。它解决了在测试、保护隐私的数据共享以及扩充小规模数据集时需要真实数据的问题,同时不泄露原始敏感信息。
它如何工作
该框架利用预训练的基于Transformer的语言模型(LLMs)将表格数据视为一系列标记序列。它可以以三种主要模式运行:
- 基于训练的生成:使用
fit()在真实数据集上微调模型,然后通过sample()生成新样本。 - 模拟数据生成:可以在无需任何真实训练数据的情况下,从声明式模式(定义类型、范围和分布)生成合成行。
- 插补:可以根据学习到的分布填充现有数据集中的缺失值(NaN)。
为了优化性能,它支持 LoRA(低秩适应)以实现高效的微调,并提供“引导采样”功能,用于复杂特征集,以确保生成质量更高。
适用人群
需要合成表格数据以实现隐私安全的虚拟数据、测试用例、开发环境以及为下游机器学习任务扩充数据集的数据科学家、机器学习工程师和开发者。
主要特性
- 条件生成:生成满足特定逻辑约束的数据(例如
age >= 30)。 - 实时质量监控:在训练过程中使用
ColumnShapes相似性跟踪合成质量。 - 全面的评估套件:内置指标用于统计相似性、下游实用性(机器学习效率)和隐私保护(例如 k-匿名化、成员推断)。
- 高效的微调:集成 LoRA,降低在消费级硬件上的内存占用和训练时间。
- 灵活的基于模式的模拟:无需训练集即可从 JSON/YAML 模式创建真实数据。
一个强大的框架,能够利用预训练的Transformer语言模型生成高质量的合成表格数据,支持基于训练和基于模式的生成方式。 — @username
相关
- 项目
- 项目
- 项目
- 项目
- 项目