tabularis-ai/be_great

A novel approach for synthesizing tabular data using pretrained large language models

What it solves

GReaT (Generation of Realistic Tabular data) は、高品質な合成テーブルデータを生成するために設計されたフレームワークです。テスト、プライバシーを保護したデータ共有、および元の機密情報を損なうことなく小規模なデータセットを拡張する必要があるという問題に対処します。

How it works

このフレームワークは、事前学習済みの Transformer ベースの言語モデル (LLMs) を活用して、テーブルデータをトークンのシーケンスとして扱います。主に 3 つのモードで動作します:

  1. Training-based Generation: モデルは fit() を使用して実際のデータセットでファインチューニングされ、その後 sample() を介して新しいサンプルを生成します。
  2. Mock Data Generation: 実際のトレーニングデータを必要とせずに、宣言的なスキーマ(型、範囲、分布を定義)から合成行を生成できます。
  3. Imputation: 学習された分布に基づいて、既存のデータセット内の欠損値 (NaNs) を埋めることができます。

パフォーマンスを最適化するために、効率的なファインチューニングのための LoRA (Low-Rank Adaptation) をサポートし、複雑な特徴量セットに対してより高品質な生成を保証するための「guided sampling」を提供します。

Who it’s for

プライバシーに配慮したダミーデータ、テストフィクスチャ、開発環境、およびダウンストリームの ML タスクのためのデータセット拡張のために、合成テーブルデータが必要なデータサイエンティスト、ML エンジニア、および開発者。

Highlights

  • Conditional Generation: 特定の論理的制約(例:age >= 30)を満たすデータを生成します。
  • Live Quality Monitoring: トレーニングプロセス中に ColumnShapes の類似性を使用して合成の品質を追跡します。
  • Comprehensive Evaluation Suite: 統計的類似性、ダウンストリームの有用性 (ML Efficiency)、およびプライバシー (例:k-Anonymization, Membership Inference) のための組み込みメトリクス。
  • Efficient Fine-Tuning: コンシューマー向けハードウェアでのメモリとトレーニング時間を削減するための LoRA との統合。
  • Flexible Schema-based Mocking: トレーニングセットを必要とせずに、JSON/YAML スキーマから現実的なデータを生成します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト