HUANGLIZI/LViT
[IEEE Transactions on Medical Imaging/TMI 2023] This repo is the official implementation of "LViT: Language meets Vision Transformer in Medical Image Segmentation"
何を解決するか
LViTは、言語と視覚の変換器を組み合わせることで、医療画像のセグメンテーションの課題に対処します。視覚データに加えて、テキスト記述を活用することで、CTスキャンなどの医療画像における解剖学的構造や病変の輪郭をより正確に抽出することを目指しています。
動作方法
このプロジェクトは、言語情報を統合してセグメンテーションプロセスをガイドするVision Transformer (ViT)ベースのアーキテクチャを実装しています。事前学習と微調整のワークフローをサポートしており、事前学習済みの重みでモデルを初期化することで、特定の医療データセット上で高い性能を達成できます。
対象ユーザー
このツールは、特にコロナウイルス感染症(COVID-19)のCTスキャンや食道癌放射線治療に焦点を当てた、自動医療画像セグメンテーションに取り組む医療画像研究者やAI開発者向けに設計されています。
主な特徴
- マルチモーダル統合: 言語と視覚の変換器を統合し、セグメンテーションの精度を向上。
- 詳細なベンチマーク: QaTa-COV19、MosMedData+、MoNuSegなど複数のデータセットにおけるDiceスコアとIoUスコアなどの性能指標を提供。
- 事前学習サポート: 最終的なセグメンテーション結果を向上させるために、モデルの事前学習オプションを含む。
- 再現性の重視: 実験間で一貫した結果を確保するために、決定論モードとランダムシードの設定を実装。
関連
- プロジェクト
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト