tabularis-ai/be_great

A novel approach for synthesizing tabular data using pretrained large language models

해결하는 문제

GReaT (Generation of Realistic Tabular data)는 고품질의 합성 표 형식 데이터를 생성하기 위해 설계된 프레임워크입니다. 테스트를 위한 현실적인 데이터, 개인정보 보호를 위한 데이터 공유, 그리고 원본 민감 정보를 유출하지 않고 소규모 데이터셋을 증강해야 하는 문제를 해결합니다.

작동 방식

이 프레임워크는 사전 훈련된 Transformer 기반 언어 모델(LLM)을 활용하여 표 형식 데이터를 토큰의 시퀀스로 취급합니다. 주로 세 가지 주요 모드로 작동할 수 있습니다:

  1. 훈련 기반 생성: fit()을 사용해 실제 데이터셋에 모델을 미세 조정한 후 sample()을 통해 새로운 샘플을 생성합니다.
  2. 가짜 데이터 생성: 실제 훈련 데이터가 필요 없이 선언형 스키마(유형, 범위, 분포 정의)로부터 합성 행을 생성할 수 있습니다.
  3. 누락 값 보정: 학습된 분포를 기반으로 기존 데이터셋의 누락된 값(NaN)을 채울 수 있습니다.

성능 최적화를 위해 LoRA(Low-Rank Adaptation)를 지원하여 효율적인 미세 조정을 가능하게 하며, 복잡한 특성 집합에 대해 더 높은 품질의 생성을 보장하기 위한 "가이드 샘플링"도 제공합니다.

대상 사용자

개인정보 보호를 고려한 가짜 데이터, 테스트 피규어, 개발 환경, 하류 ML 작업을 위한 데이터셋 증강이 필요한 데이터 과학자, ML 엔지니어, 개발자들입니다.

주요 기능

  • 조건부 생성: 특정 논리적 제약 조건을 만족하는 데이터 생성 (예: age >= 30)
  • 실시간 품질 모니터링: 훈련 과정 중 ColumnShapes 유사도를 사용해 합성 품질을 추적합니다.
  • 포괄적인 평가 도구: 통계적 유사성, 하류 활용도(ML 효율성), 개인정보 보호(예: k-익명성, 멤버십 추론)를 위한 내장 메트릭이 있습니다.
  • 효율적인 미세 조정: 소비자용 하드웨어에서 메모리와 훈련 시간을 줄이기 위해 LoRA와 통합되어 있습니다.
  • 유연한 스키마 기반 가짜 데이터 생성: 훈련 세트가 필요 없이 JSON/YAML 스키마로부터 현실적인 데이터를 생성할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트