Desbordante/desbordante-core

Desbordante is a high-performance data profiler that is capable of discovering many different patterns in data using various algorithms. It also allows to run data cleaning scenarios using these algorithms. Desbordante has a console version and an easy-to-use web application.

何を解決するか

Desbordanteは、データセット内の複雑なパターンを発見・検証するための高性能なデータプロファイリングツールです。ユーザーが構造的関係、データ品質の問題、および隠れたインサイトを特定するのを支援し、科学的仮説の生成、ビジネスデータのクリーニング、機械学習の特徴量エンジニアリングに活用できます。

動作方法

このツールは、以下の3つの主要なタスクを実行するためのさまざまなアルゴリズムを採用しています:

  • 発見: データセット内に特定のパターンタイプのすべてのインスタンスを特定する。
  • 検証: 特定のパターンインスタンスが存在するかを確認し、存在しない場合の説明(例:矛盾する行)を提供する。
  • 動的タスク: 特定のパターンに特化したバリアントで、テーブル全体を再処理するのではなく、データの変更に応じて結果を更新するため、大幅に高速化される。

多数のパターンをサポートしており、正確なおよび近似された関数的依存、包含依存、関連規則、否定制約、差分依存などが含まれます。

対象ユーザー

  • データサイエンティストおよびMLエンジニア: 機械学習の訓練データにおける特徴量エンジニアリングやアブレーションスタディに。
  • ビジネスアナリスト: データエラーの修正、重複の削除、スキーママッチングに。
  • 研究者: 実験的な科学データから発見されたパターンに基づいた仮説の構築に。
  • データベース管理者: 主キー/外部キーの回復や整合性制約の設定に。

特徴

  • 広範なパターンライブラリ: 確率的、曖昧、グラフベースの依存など、数十種類のパターンタイプをサポート。
  • 複数のインターフェース: コマンドラインツール、Pythonライブラリ(pandas DataFramesと統合)、インタラクティブなWebアプリケーションとして利用可能。
  • 高性能: 効率性を実現するため、pybind11を介したPythonバインディングを持つC++コアライブラリを搭載。
  • 実用的なデモシナリオ: タイポ検出、データの重複除去、異常検出のための組み込みロジックを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト