HUANGLIZI/LViT

[IEEE Transactions on Medical Imaging/TMI 2023] This repo is the official implementation of "LViT: Language meets Vision Transformer in Medical Image Segmentation"

解決的問題

LViT 透過結合語言與視覺變換器,解決醫學影像分割的挑戰。它旨在透過結合文字描述與視覺資料,提升在醫學掃描(例如 CT 掃描)中勾勒解剖結構或病灶的準確性。

工作原理

此專案實作一種基於視覺變換器(ViT)的架構,整合語言資訊以引導分割過程。支援預訓練與微調工作流程,允許模型以預訓練權重初始化,進而於特定醫學資料集上達成更高性能。

適用對象

此工具專為從事自動化醫學影像分割的醫學影像研究人員與 AI 開發者設計,特別適合專注於 COVID-19 CT 掃描或食道癌放射治療的研究人員。

主要亮點

  • 多模態整合:結合語言與視覺變換器,提升分割效能。
  • 詳細基準測試:提供在 QaTa-COV19、MosMedData+ 與 MoNuSeg 等多個資料集上的性能指標(Dice 與 IoU 分數)。
  • 支援預訓練:包含預訓練模型選項,以增強最終分割結果。
  • 重視可重現性:實作決定性模式與隨機種子設定,確保實驗間結果一致。

相關