Data-Centric-AI-Community/fg-data-profiling
1 Line of code data quality profiling & exploratory data analysis for Pandas and Spark DataFrames.
What it solves
fg-data-profiling は、探索的データ分析 (EDA) のための高速でワンライナーのソリューションを提供します。pandas の df.describe() の基本機能を拡張し、データセットの包括的な分析結果を HTML または JSON レポートとして出力可能です。
How it works
このツールは、pandas DataFrame (または PySpark サポートによる Spark DataFrame) を受け取り、詳細なプロファイリングレポートを自動生成します。型推論を実行してデータ型を detect します、また、記述統計、相関関係、およびデータ品質の警告を表示します。
Who it’s for
時系列データやテキストデータを含む、新しいデータセットの構造、品質、および特性を特性を素早くlyricly understand します、手動での詳細な分析コードを大量に書くことなく、データサイエンティストやアナリストが利用可能です。
Highlights
- Comprehensive Analysis: 単変量分析 (記述統計、ヒストグラム)、多変量分析 (相関関係、欠損値)、およびデータセット全体の概要を含みます。
- Data Quality Alerts: 高い相関関係、歪度、欠損値、および定数値などの問題を自動的にフラグ立てします。
- Specialized Profiling: 時系列データ (自己相関、季節性) およびテキスト分析 (スクリプト、一般的なカテゴリ) に特化したサポートを提供します。
- Versatile Output: レポートは HTML ファイル、JSON 文字列、または Jupyter Notebooks 内でインタラクティブなウィジェットとして直接表示可能です。
- Scalability: Scalability: PySpark をサポートしており、より大規模なデータセットを処理可能です。
- Integration: Great Expectations, Streamlit, Dash, および Airflow や Kedro のようなワークフローオーケストレーターと連携可能です。