Data-Centric-AI-Community/fg-data-profiling

1 Line of code data quality profiling & exploratory data analysis for Pandas and Spark DataFrames.

What it solves

fg-data-profiling은 탐색적 데이터 분석 (EDA)를 위한 빠르고 간편한 한 줄 명령 솔루션을 제공합니다. pandas df.describe()의 기본 기능을 확장하여 데이터셋에 대한 포괄적인 분석을 제공하며, 이는 HTML 또는 JSON 보고서로 내보보낼 수 있습니다.

How it works

이 도구는 pandas DataFrame (또는 PySpark 지원을 통한 Spark DataFrame)을 입력받아 상세한 프로파일링 보고서를 자동으로 생성합니다. 데이터 유형을 감지하기 위해 타입 추론을 수행하고 기술 통계량, 상관관계, 데이터 품질 경고를 계산합니다.

Who it’s for

방대한 수동 분석 코드를 작성할 필요 없이 시계열 및 텍스트 데이터를 포함한 새로운 데이터셋의 구조, 품질 및 특성을 빠르게 이해해야 하는 데이터 과학자 및 분석가.

Highlights

  • Comprehensive Analysis: 단변량 분석 (기술 통계량, 히스토그램), 다변량 분석 (상관관계, 결여측 데이터), 그리고 데이터셋 전체 개요를 포함합니다.

  • Data Quality Alerts: 높은 상관관계, 왜도, 결측치, 그리고 상수값과 같은 문제를 자동으로 플래그합니다.

  • Specialized Profiling: 시계열 (자기 상관, 계절성) 및 텍스트 분석 (특기에 특화된 지원)을 제공합니다.

  • Versatile Output: 보고서는 HTML 파일, JSON 문자열, 또는 Jupyter Notebooks 내에서 인터랙티브한 위젯으로 직접 렌더링할 수 있습니다.

  • Scalability: 더 큰 데이터셋을 처리를 위해 PySpark 지원을 포함합니다.

  • Integration: Great Expectations, Streamlit, Dash, 그리고 Airflow 및 Kedro와 같은 워크플로우 오케스트레이터와 연결됩니다.