healthylaife/MIMIC-IV-Data-Pipeline

A customizable pipeline for multimodal data extraction from MIMIC-IV!

解決的問題

處理 MIMIC-IV 醫學數據集傳統上是一項手動且分散的工作,因為數據儲存在多種模態中(結構化生命體徵、非結構化註釋、波形和影像),這些數據很難為機器學習進行對齊和預處理。該流水線實現了這些多樣化數據源的集成、清洗和對齊,將其轉換為統一的、可用於分析的格式。

工作原理

該框架提供了一個端到端的工作流,將原始 PhysioNet 數據轉換為個性化的患者隊列。它透過去除離群值和填補缺失值來清洗原始數據,並透過使用標準編碼系統對醫學特徵進行分組來降低維度。為了處理醫學記錄的時間特性,它將連續數據分桶到等長的的時間間隔中,以建立平滑的時間序列數據集。

對於多模態集成,它利用專門的套件(MIMICSectionizerMIMICEmbedding)對臨床註釋進行分段,並為文本、ECG 信號、波形、胸部 X 光和超聲心動圖生成嵌入。該流水線還包括用於預測的內建序列模型以及用於衡量性能和群體公平性的評估模組。

適用對象

使用 MIMIC-IV 數據集,並需要一種可重複的方法來為下游預測建模準備多模態 EHR(電子健康紀錄)數據的醫學研究人員和數據科學家。

亮點

  • 多模態集成:系統地整合了五種模態:結構化數據、非結構化註釋、波形、ECG 和影像 (CXR/ECHO)。
  • 可定制隊列:允許用戶使用 ICD-9 和 ICD-10 編碼或疾病名稱定義特定的患者組。
  • 時間對齊:將連續數據分桶到等長的的時間間隔中,以實現一致的時間序列表示。
  • 公平性評估:包含一個專用模組,用於報告已訓練模型的個人和群體公平性指標。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案