pdpipe/pdpipe
Easy pipelines for pandas DataFrames.
해결하는 문제
pdpipe 는 pandas DataFrames 에 대한 데이터 전처리 파이프라인을 만드는 과정을 간소화합니다. 조각나고 반복적인 데이터 정제 및 변환 단계를 구조적이고 체인 가능한 작업 시퀀스로 대체합니다.
작동 방식
이 라이브러리는 연결 가능한 "스테이지"(변환 단계)의 세트를 제공합니다. 사용자는 이러한 스테이지를 연결하여 파이프라인을 정의하고, 전체 파이프라인을 DataFrame 에 적용합니다. 열 삭제, 원핫 인코딩, 값 매핑과 같은 일반적인 작업을 지원하며, scikit-learn 변환기와 통합 가능하면서도 DataFrame 열 컨텍스트를 유지합니다.
대상 사용자
데이터 준비에 pandas 를 사용하고 특징 공학 및 전처리를 더 체계적이고 재현 가능한 방식으로 다루고자 하는 데이터 과학자 및 분석가.
주요 기능
- 사전 준비된 스테이지: 열 삭제, 값 필터링, 원핫 인코딩, 특징 생성을 위한 내장 도구 포함.
- 시각적 진단: 파이프라인을 Graphviz DOT 다이어그램으로 생성하여 시각화 가능.
- 드라이런 진단: 각 스테이지별 구조화된 진단을 위한
.trace()메서드 제공. - 병렬 실행: 행 및 열 적용에 대해 선택적 스레드 기반 병렬 실행 지원.
- scikit-learn 통합: scikit-learn 변환기를 래핑하여 pandas DataFrames 와 원활하게 작동하도록 보장.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트