facebookresearch/balance
The balance python package offers a simple workflow and methods for dealing with biased data samples when looking to infer from them to some target population of interest.
해결하는 문제
balance는 설문조사나 관찰 연구와 같은 데이터 샘플에서 표본이 타겟 인구를 정확히 반영하지 못하는 편향을 완화하기 위해 설계되었습니다. 이는 표본 편향 또는 응답률 편향이 존재할 때 발생하며, 샘플 데이터로부터 인구 수준의 특성을 추론하는 데 어려움을 초래합니다.
작동 방식
이 패키지는 샘플 내 각 단위에 대한 가중치를 적합하고 평가하는 워크플로우를 구현합니다. 이러한 가중치는 특정 응답자가 타겟 인구에서 몇 명의 사람을 대표하는지를 나타내며, 보조 정보(공변량)의 분포가 타겟 인구와 일치하도록 샘플을 "균형 조정"하는 효과를 줍니다.
조정을 위한 주요 방법은 다음과 같습니다:
- 역확률 가중치(IPW): L1(LASSO) 정규화를 사용.
- 공변량 균형 확률 점수(CBPS).
- 사후층화(Post-stratification).
- 라킹(Raking).
또한, 역확률 가중치 평균($\mu\hat{}{IPW}$) 또는 결과 모델 추정치($\mu\hat{}{OM}$)를 사용하여 인구 수준의 결과를 추정하는 도구를 제공하며, 이중로버스트(AIPW) 추정기도 지원합니다.
대상 사용자
연구자, 설문 방법론가, 인구통계학자, UX 연구자, 마케팅 리서처, 데이터 사이언티스트 또는 머신러닝 엔지니어 중에서 편향된 샘플을 균형 조정하여 정확한 인구 수준 추정을 수행해야 하는 분들을 대상으로 합니다.
주요 기능
- 다양한 조정 방법: IPW, CBPS, 라킹, 라킹 사후층화를 지원.
- 포괄적인 진단 도구: 조정 전후 공변량 균형을 시각화하기 위해 막대 그래프, 밀도 그래프, QQ 플롯, "Love 플롯"을 제공.
- 통계적 요약: 가중치 품질을 평가하기 위해 절대 표준화 평균 차이(ASMD)와 Kish의 설계 효과를 제공.
diff-diff통합:balance에서 생성된 가중치를 사용하여 차이의 차이(Difference-in-Differences) 분석을 수행할 수 있는 가벼운 어댑터 제공.- 결과 추정: IPW와 결과 모델 추정기 모두를 지원하여 로버스트성 검증 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트