tabularis-ai/be_great
A novel approach for synthesizing tabular data using pretrained large language models
What it solves
GReaT (Generation of Realistic Tabular data) は、高品質な合成テーブルデータを生成するために設計されたフレームワークです。テスト、プライバシーを保護したデータ共有、および元の機密情報を損なうことなく小規模なデータセットを拡張する必要があるという問題に対処します。
How it works
このフレームワークは、事前学習済みの Transformer ベースの言語モデル (LLMs) を活用して、テーブルデータをトークンのシーケンスとして扱います。主に 3 つのモードで動作します:
- Training-based Generation: モデルは
fit()を使用して実際のデータセットでファインチューニングされ、その後sample()を介して新しいサンプルを生成します。 - Mock Data Generation: 実際のトレーニングデータを必要とせずに、宣言的なスキーマ(型、範囲、分布を定義)から合成行を生成できます。
- Imputation: 学習された分布に基づいて、既存のデータセット内の欠損値 (NaNs) を埋めることができます。
パフォーマンスを最適化するために、効率的なファインチューニングのための LoRA (Low-Rank Adaptation) をサポートし、複雑な特徴量セットに対してより高品質な生成を保証するための「guided sampling」を提供します。
Who it’s for
プライバシーに配慮したダミーデータ、テストフィクスチャ、開発環境、およびダウンストリームの ML タスクのためのデータセット拡張のために、合成テーブルデータが必要なデータサイエンティスト、ML エンジニア、および開発者。
Highlights
- Conditional Generation: 特定の論理的制約(例:
age >= 30)を満たすデータを生成します。 - Live Quality Monitoring: トレーニングプロセス中に
ColumnShapesの類似性を使用して合成の品質を追跡します。 - Comprehensive Evaluation Suite: 統計的類似性、ダウンストリームの有用性 (ML Efficiency)、およびプライバシー (例:k-Anonymization, Membership Inference) のための組み込みメトリクス。
- Efficient Fine-Tuning: コンシューマー向けハードウェアでのメモリとトレーニング時間を削減するための LoRA との統合。
- Flexible Schema-based Mocking: トレーニングセットを必要とせずに、JSON/YAML スキーマから現実的なデータを生成します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト