HUANGLIZI/LViT
[IEEE Transactions on Medical Imaging/TMI 2023] This repo is the official implementation of "LViT: Language meets Vision Transformer in Medical Image Segmentation"
해결하는 문제
LViT는 언어와 시각 변환기(Transformer)를 결합하여 의료 영상 세그멘테이션의 과제를 해결합니다. 시각 데이터와 함께 텍스트 설명을 활용함으로써 CT 스캔과 같은 의료 영상에서 해부학적 구조나 병변을 더 정확하게 추출하는 것을 목표로 합니다.
작동 방식
이 프로젝트는 언어 정보를 통합하여 세그멘테이션 프로세스를 안내하는 Vision Transformer (ViT) 기반 아키텍처를 구현합니다. 사전 훈련 및 미세 조정 워크플로우를 지원하며, 사전 훈련된 가중치로 모델을 초기화함으로써 특정 의료 데이터셋에서 높은 성능을 달성할 수 있습니다.
대상 사용자
이 도구는 특히 코로나19 CT 스캔이나 식도암 방사선 치료에 초점을 맞춘 자동 의료 영상 세그멘테이션에 종사하는 의료 영상 연구자 및 AI 개발자들을 위한 것입니다.
주요 특징
- 다중 모달 통합: 언어와 시각 변환기를 통합하여 세그멘테이션 정확도를 향상시킵니다.
- 세부 벤치마킹: QaTa-COV19, MosMedData+, MoNuSeg 등 여러 데이터셋에서 Dice 및 IoU 점수와 같은 성능 지표를 제공합니다.
- 사전 훈련 지원: 최종 세그멘테이션 결과를 향상시키기 위해 모델의 사전 훈련 옵션을 포함합니다.
- 재현성 중시: 실험 간 일관된 결과를 보장하기 위해 결정론적 모드와 랜덤 시드 설정을 구현합니다.
관련
- 프로젝트
- Dispatch
- Dispatch
- 프로젝트
- 프로젝트