HUANGLIZI/LViT

[IEEE Transactions on Medical Imaging/TMI 2023] This repo is the official implementation of "LViT: Language meets Vision Transformer in Medical Image Segmentation"

解决的问题

LViT 通过结合语言和视觉变换器,解决了医学图像分割的挑战。它旨在通过利用文本描述与视觉数据相结合,提高在医学扫描(如 CT 扫描)中勾画解剖结构或病灶的准确性。

工作原理

该项目实现了一种基于视觉变换器(ViT)的架构,将语言信息整合以指导分割过程。它支持预训练和微调工作流,允许模型使用预训练权重初始化,从而在特定医学数据集上实现更高性能。

适用人群

此工具专为从事自动化医学图像分割的医学影像研究人员和 AI 开发者设计,尤其适用于专注于 COVID-19 CT 扫描或食道癌放疗的研究人员。

主要亮点

  • 多模态融合:结合语言和视觉变换器,提升分割性能。
  • 详细基准测试:提供在 QaTa-COV19、MosMedData+ 和 MoNuSeg 等多个数据集上的性能指标(Dice 和 IoU 分数)。
  • 支持预训练:包含预训练模型选项,以增强最终分割结果。
  • 注重可复现性:实现确定性模式和随机种子设置,确保实验间结果一致。

相关