healthylaife/MIMIC-IV-Data-Pipeline
A customizable pipeline for multimodal data extraction from MIMIC-IV!
해결하는 문제
MIMIC-IV 의료 데이터셋 처리는 데이터가 여러 모달리티(구조화된 바이탈 사인, 비구조화된 노트, 파형 및 영상)에 걸쳐 저장되어 있어 머신러닝을 위한 정렬 및 전처리가 어렵기 때문에 전통적으로 수동적이고 분절된 작업이었습니다. 이 파이프라인은 이러한 다양한 데이터 소스를 통합, 정제 및 정렬하여 단일화된 분석 준비 상태의 형식으로 자동화합니다.
작동 방식
이 프레임워크는 원시 PhysioNet 데이터를 개인화된 환자 코호트로 변환하는 엔드 투 엔드 워크플로우를 제공합니다. 이상치를 제거하고 결측치를 보충하여 원시 데이터를 정제하며, 표준 코딩 시스템을 사용하여 의료 특징을 그룹화함으로써 차원을 축소합니다. 의료 기록의 시간적 특성을 처리하기 위해 연속적인 데이터를 동일한 길이의 시간 간격으로 빈(bin) 처리하여 매끄러운 시계열 데이터셋을 생성합니다.
멀티모달 통합을 위해 MIMICSectionizer 및 MIMICEmbedding과 같은 전문 패키지를 사용하여 임상 노트를 섹션화하고 텍스트, ECG 신호, 파형, 흉부 X선 및 심초음파에 대한 임베딩을 생성합니다. 또한 이 파이프라인에는 예측을 위한 내장 시퀀셜 모델과 성능 및 그룹 공정성을 측정하는 평가 모듈이 포함되어 있습니다.
대상
MIMIC-IV 데이터셋을 사용하여 다운스트림 예측 모델링을 위한 멀티모달 EHR(전자 건강 기록) 데이터를 준비하는 데 재현 가능한 방법이 필요한 의료 연구자 및 데이터 과학자.
주요 특징
- 멀티모달 통합: 5가지 모달리티(구조화된 데이터, 비구조화된 노트, 파형, ECG 및 영상(CXR/ECHO))를 체계적으로 통합합니다.
- 사용자 정의 코호트: ICD-9 및 ICD-10 코드 또는 질병 이름을 사용하여 특정 환자 그룹을 정의할 수 있습니다.
- 시간적 정렬: 연속적인 데이터를 동일한 길이의 간격으로 빈 처리하여 일관된 시계열 표현을 제공합니다.
- 공정성 평가: 학습된 모델에 대한 개인 및 그룹 공정성 측정치를 보고하기 위한 전용 모듈이 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트