healthylaife/MIMIC-IV-Data-Pipeline

A customizable pipeline for multimodal data extraction from MIMIC-IV!

解决的问题

处理 MIMIC-IV 医学数据集传统上是一项手动且分散的工作,因为数据存储在多种模态中(结构化生命体征、非结构化注释、波形和影像),这些数据很难为机器学习进行对齐和预处理。该流水线实现了这些多样化数据源的集成、清洗和对齐,将其转换为统一的、可用于分析的格式。

工作原理

该框架提供了一个端到端的工作流,将原始 PhysioNet 数据转换为个性化的患者队列。它通过去除离群值和填补缺失值来清洗原始数据,并通过使用标准编码系统对医学特征进行分组来降低维度。为了处理医学记录的时间特性,它将连续数据分桶到等长的的时间间隔中,以创建平滑的时间序列数据集。

对于多模态集成,它利用专门的包(MIMICSectionizerMIMICEmbedding)对临床注释进行分段,并为文本、ECG 信号、波形、胸部 X 光和超声心动图生成嵌入。该流水线还包括用于预测的内置序列模型以及用于衡量性能和群体公平性的评估模块。

适用对象

使用 MIMIC-IV 数据集,并需要一种可重复的方法来为下游预测建模准备多模态 EHR(电子健康记录)数据的医学研究人员和数据科学家。

亮点

  • 多模态集成:系统地整合了五种模态:结构化数据、非结构化注释、波形、ECG 和影像 (CXR/ECHO)。
  • 可定制队列:允许用户使用 ICD-9 和 ICD-10 编码或疾病名称定义特定的患者组。
  • 时间对齐:将连续数据分桶到等长的时间间隔中,以实现一致的时间序列表示。
  • 公平性评估:包含一个专用模块,用于报告已训练模型的个人和群体公平性指标。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目