capitalone/DataProfiler
What's in your data? Extract schema, statistics and entities from datasets
해결하는 문제
DataProfiler는 데이터 세트 내의 민감한 정보를 분석, 모니터링 및 탐지하는 프로세스를 단순화합니다. 다양한 파일 형식에 걸쳐 데이터 스키마를 식별하고, 통계를 계산하며, 개인 식별 정보(PII) 또는 비공개 정보(NPI)를 인식하는 지루한 작업을 자동화합니다.
작동 방식
이 라이브러리는 Data 클래스를 사용하여 파일(CSV, Parquet, JSON, Avro 등)을 자동으로 감지하고 Pandas DataFrame으로 로드합니다. 그런 다음 Profiler가 이 데이터를 분석하여 프로필(전역 통계(예: 행 수, null 비율) 및 열 수준 통계(예: 평균, 분산, 고유 수)를 포함하는 딕셔너리)를 생성합니다. 민감한 데이터 탐지를 위해 사전 학습된 딥러닝 모델을 사용하여 이메일 주소, 신용카드 번호 및 SSN과 같은 엔티티에 레이블을 지정합니다. 사용자는 새로운 엔티티 또는 사용자 정의 인식 파이프라인을 사용하여 모델을 확장할 수도 있습니다.
대상 사용자
품질 또는 규정 준수를 위해 데이터 세트를 신속하게 감사해야 하는 데이터 과학자, 데이터 엔지니어 및 보안 분석가, 특히 개인 정보 보호를 위해 민감한 데이터를 식별해야 하는 사용자를 위해 설계되었습니다.
주요 특징
- 자동 민감 데이터 탐지: 사전 학습된 딥러닝 모델을 사용하여 PII/NPI 엔티티를 식별합니다.
- 폭넓은 형식 지원: CSV, TSV, JSON, Avro, Parquet, 텍스트 파일 및 URL과 호환됩니다.
- 포괄적인 통계: 지니 불순도 및 상관 행렬을 포함한 상세한 전역 및 열 수준 메트릭을 제공합니다.
- 유연한 프로파일링: 구조화된 데이터, 비구조화된 데이터 및 그래프 기반 데이터 프로파일링을 지원합니다.
- 확장 가능한 워크플로: 새로운 데이터 배치로 기존 프로필을 업데이트하거나 추가 연산자를 사용하여 여러 프로필을 병합할 수 있습니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트