Desbordante/desbordante-core
Desbordante is a high-performance data profiler that is capable of discovering many different patterns in data using various algorithms. It also allows to run data cleaning scenarios using these algorithms. Desbordante has a console version and an easy-to-use web application.
해결하는 문제
Desbordante는 데이터셋 내 복잡한 패턴을 탐지하고 검증하기 위해 설계된 고성능 데이터 프로파일러입니다. 사용자가 구조적 관계, 데이터 품질 문제, 그리고 숨겨진 통찰을 식별할 수 있도록 도와주며, 과학적 가설 생성, 비즈니스 데이터 정제, 머신러닝 특징 공학에 활용할 수 있습니다.
작동 방식
이 도구는 다양한 알고리즘을 사용하여 세 가지 주요 작업을 수행합니다:
- 탐지: 데이터셋 내 특정 패턴 유형의 모든 인스턴스를 식별합니다.
- 검증: 특정 패턴 인스턴스가 존재하는지 확인하고, 존재하지 않을 경우 설명(예: 충돌하는 행)을 제공합니다.
- 동적 작업: 특정 패턴에 특화된 변형으로, 전체 테이블을 다시 처리하는 대신 데이터 변경에 따라 결과를 업데이트하여 속도를 크게 향상시킵니다.
정확한 및 근사적인 함수적 종속성, 포함 종속성, 연관 규칙, 거부 제약, 차이 종속성 등 다양한 패턴을 지원합니다.
대상 사용자
- 데이터 과학자 및 ML 엔지니어: 머신러닝 학습 데이터의 특징 공학 및 아블레이션 연구에.
- 비즈니스 분석가: 데이터 오류 정리, 중복 제거, 스키마 매칭에.
- 연구자: 실험 과학 데이터에서 발견된 패턴을 기반으로 가설을 수립할 때.
- 데이터베이스 관리자: 기본 키/외래 키 복구 및 무결성 제약 설정에.
주요 특징
- 풍부한 패턴 라이브러리: 확률적, 흐린, 그래프 기반 종속성 등 수십 가지 패턴 유형을 지원합니다.
- 다양한 인터페이스: 명령줄 도구, Python 라이브러리(pandas DataFrames 통합), 인터랙티브 웹 애플리케이션으로 제공됩니다.
- 고성능: 효율성을 위해 pybind11를 통해 Python 바인딩을 제공하는 C++ 코어 라이브러리를 사용합니다.
- 실용적인 데모 시나리오: 오타 탐지, 데이터 중복 제거, 이상 탐지에 대한 내장 로직을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트