Data-Centric-AI-Community/fg-data-profiling
1 Line of code data quality profiling & exploratory data analysis for Pandas and Spark DataFrames.
What it solves
fg-data-profiling 提供了一個快速、單行指令的探索性數據分析 (EDA) 解決方案。它擴展了 pandas df.describe() 的基本功能,以提供數據集的全面分析,並可將結果匯出為 HTML 或 JSON 報告。
How it works
該工具接收一個 pandas DataFrame (或透過 PySpark 支援的 Spark DataFrame) 並自動生成詳細的剖析報告。它執行類型推斷以檢測數據類型,並計算描述性統計、相關性以及數據品質警告。
Who it’s for
數據科學家和分析師,需要快速理解新數據集的結構、品質與特性(包括時間序列和文本數據),而無需編寫大量的手動分析代碼。
Highlights
- Comprehensive Analysis: 包括單變量分析 (描述性統計、直方圖)、多變量分析 (相關性、缺失數據) 以及全局數據集概覽。
- Data Quality Alerts: 自動標記如高相關性、偏度、缺失值與常數值等問題。
- Specialized Profiling: 專門支援時間序列 (自動相關性、季節性) 與文本分析 (腳本、常見類別)。
- Versatile Output: 報告可以匯出為 HTML 檔案、JSON 字串,或直接在 Jupyter Notebooks 中渲染為互動式組件。
- Scalability: 包含對 PySpark 的支援,以處理更大的數據集。
- Integration: 與 Great Expectations, Streamlit, Dash, 以及工作流編排器如 Airflow 和 Kedro 進行連接。