tabularis-ai/be_great

A novel approach for synthesizing tabular data using pretrained large language models

它解決的問題

GReaT(真實表格資料的生成)是一個設計用於產生高品質合成表格資料的框架。它解決了在測試、保護隱私的資料共享以及在不損及原始敏感資訊的情況下擴增小資料集時,需要真實資料的問題。

如何運作

該框架利用預先訓練的基於 Transformer 的語言模型(LLM)將表格資料視為一連串的標記。它可以在三種主要模式下運作:

  1. 基於訓練的生成:模型使用 fit() 在真實資料集上進行微調,然後透過 sample() 產生新樣本。
  2. 模擬資料生成:它可以在不需要任何真實訓練資料的情況下,從宣告式結構(定義類型、範圍和分佈)生成合成資料列。
  3. 填補缺失值:它能根據學習到的分佈,填補現有資料集中的缺失值(NaN)。

為了優化效能,它支援 LoRA(低秩適應)以實現高效的微調,並提供「引導式採樣」功能,以確保複雜特徵集的高品質生成。

適用對象

需要合成表格資料以進行隱私安全的虛擬資料、測試範例、開發環境,以及為下游機器學習任務擴增資料集的資料科學家、機器學習工程師和開發人員。

主要特色

  • 條件式生成:產生符合特定邏輯約束的資料(例如 age >= 30)。
  • 即時品質監控:在訓練過程中使用 ColumnShapes 相似性來追蹤合成品質。
  • 全面的評估套件:內建統計相似性、下游實用性(機器學習效率)和隱私保護(例如 k-匿名化、成員推斷)的評估指標。
  • 高效微調:整合 LoRA,以減少消費級硬體上的記憶體使用和訓練時間。
  • 靈活的基於結構的模擬:僅需 JSON/YAML 結構即可產生真實的資料,無需訓練資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案