healthylaife/MIMIC-IV-Data-Pipeline
A customizable pipeline for multimodal data extraction from MIMIC-IV!
解決する課題
MIMIC-IV医療データセットの処理は、データが複数のモダリティ(構造化されたバイタルサイン、非構造化テキスト、波形、画像)にわたって保存されており、機械学習のためのアライメントや前処理が困難であるため、従来は手動で行われる断片的な作業でした。このパイプラインは、これらの多様なデータソースを統合、クリーニング、およびアライメントし、分析可能な統一フォーマットへと自動化します。
仕組み
このフレームワークは、生のPhysioNetデータをパーソナライズされた患者コホートに変換するエンドツーエンドのワークフローを提供します。外れ値の除去や欠損値の補完によって生データをクリーニングし、標準的なコーディングシステムを使用して医学的特徴をグループ化することで次元削減を行います。医療記録の時間的な性質を扱うために、連続的なデータを等間隔の時間間隔にビン化し、スムーズな時系列データセットを作成します。
マルチモーダル統合のために、MIMICSectionizerおよびMIMICEmbeddingという専用のパッケージを使用して、臨床ノートをセクション化し、テキスト、ECG信号、波形、胸部X線、心エコーの埋め込み(embeddings)を生成します。また、このパイプラインには、予測用の組み込みシーケンシャルモデルと、パフォーマンスおよびグループの公平性を測定する評価モジュールが含まれています。
対象者
MIMIC-IVデータセットを使用しており、下流の予測モデリングのためにマルチモーダルなEHR(電子健康記録)データを準備するための再現可能な方法を必要とする医学研究者およびデータサイエンティスト。
ハイライト
- マルチモーダル統合: 5つのモダリティ(構造化データ、非構造化ノート、波形、ECG、画像(CXR/ECHO))を体系的に統合します。
- カスタマイズ可能なコホート: ICD-9およびICD-10コードまたは疾患名を使用して、特定の患者グループを定義できます。
- 時間的アライメント: 連続的なデータを等間隔のインターバルにビン化し、一貫した時系列表現を実現します。
- 公平性評価: 学習済みモデルの個人およびグループの公平性指標を報告するための専用モジュールが含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト