EpistasisLab/scikit-rebate

A scikit-learn-compatible Python implementation of ReBATE, a suite of Relief-based feature selection algorithms for Machine Learning.

해결하는 문제

표준 필터 기반 특성 선택 방법은 종종 단변량 연관성만 감지하고 복잡한 특성 간 상호작용을 놓치는 한계를 해결합니다. 이 패키지는 가능한 모든 쌍을 철저히 확인하지 않고도 서로 상호작용하는 중요한 특성을 계산 효율적으로 식별하는 방법을 제공합니다.

작동 방식

이웃을 고려하면서 서로 다른 클래스(또는 값)의 인스턴스를 얼마나 잘 구별하는지에 따라 특성에 가중치를 부여하는 Relief 기반 알고리즘(RBA) 모음을 구현합니다. ReliefF, SURF, MultiSWRF와 같은 여러 '코어' 알고리즘과 TuRF, VLS와 같은 '래퍼' 알고리즘을 제공하여 매우 고차원 데이터셋에서 민감도를 높입니다. 구현은 scikit-learn 호환으로, 표준 ML 파이프라인에 특성 선택 단계로 쉽게 통합할 수 있습니다.

대상 사용자

구조화된 레이블이 있는 테이블 데이터를 다루는 머신러닝 실무자와 연구자를 위해 설계되었으며, 특히 상위성(특성 상호작용) 감지가 중요한 유전체학 및 생물정보학 분야에서 유용합니다.

주요 특징

  • 상호작용 민감: 철저한 쌍별 탐색 없이 특성 간 상호작용을 감지합니다.
  • 다양한 데이터 지원: 이산형, 연속형 또는 혼합 특성 유형과 결측값을 처리합니다.
  • 유연한 엔드포인트: 이진 분류, 다중 클래스 분류 및 회귀를 지원합니다.
  • 확장 가능: 래퍼 알고리즘을 통해 10,000개에서 100,000개 이상의 특성으로 확장할 수 있습니다.
  • scikit-learn 통합: scikit-learn 파이프라인과 완전히 호환되어 원활한 엔드투엔드 워크플로우를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트