Data-Centric-AI-Community/fg-data-profiling
1 Line of code data quality profiling & exploratory data analysis for Pandas and Spark DataFrames.
What it solves
fg-data-profiling 提供了一个单行指令的探索性数据分析 (EDA) 解决方案。它扩展了 pandas df.describe() 的基本功能,以提供数据集的全面分析,并可将结果导出为 HTML 或 JSON 报告。
How it works
该工具接收一个 pandas DataFrame (or or Spark DataFrame via PySpark support) 并自动生成详细的剖析报告。它执行类型推断以检测数据类型,并计算描述性统计、相关性以及数据质量警告。
Who it’s for
数据科学家和分析师,需要快速理解新数据集的结构、质量与特性(包括时间序列和文本数据),而无需编写大量的手动分析代码。
Highlights
- Comprehensive Analysis: 包括单变量分析 (描述性统计、直方图)、多变量分析 (相关性、缺失数据), 以及全局数据集概览。
- Data Quality Alerts: 自动标记如高相关性、偏度、缺失值与常数值等问题。
- Specialized Profiling: 专门支持时间序列 (自动相关性、季节性) 与文本分析 (脚本, 常见类别)。
- Versatile Output: 报告可以导出为 HTML 文件, JSON 字符串, 或直接在 Jupyter Notebooks 中渲染为交互式组件。
- Scalability: 包含对 PySpark 的支持, 以处理更大的数据集。
- Integration: 连接与 Great Expectations, Streamlit, Dash, 和工作流编排器如 Airflow 和 Kedro。