SimonZeng7108/efficientsam3
EfficientSAM3 compresses SAM3 into lightweight, edge-friendly models via progressive knowledge distillation for fast promptable concept segmentation and tracking.
해결하는 문제
EfficientSAM3는 Segment Anything Model 3(SAM3)의 높은 계산 비용과 큰 모델 크기를 해결하여 자원 제약이 있는 장치에 더 쉽게 배포할 수 있도록 합니다. 시각 및 텍스트 인코더의 파라미터 수를 줄이면서도 경쟁력 있는 세그멘테이션 성능을 유지합니다.
작동 방식
이 프로젝트는 점진적 계층적 지식 증류를 사용하여 SAM3의 무거운 인코더를 가벼운 학습자 모델로 압축합니다. 주로 두 가지 구성 방식을 제공합니다:
- EfficientSAM3 Full Models: 시각 인코더(효율적인 ViT, RepViT, 또는 TinyViT 사용)와 텍스트 인코더(MobileCLIP 사용)를 모두 대체하여 ImageSAM3 대비 최대 90%의 크기 감소를 달성합니다.
- SAM3-LiteText: 원래 SAM3의 시각 인코더를 유지하면서 무거운 텍스트 인코더를 가벼운 MobileCLIP 버전으로 교체하여 텍스트 인코더 크기를 88% 줄입니다.
대상 사용자
고품질 이미지 및 비디오 개념 세그멘테이션을 필요로 하지만, 실시간 또는 엣지 배포를 위해 더 작고 빠르며 효율적인 모델을 원하는 연구자 및 개발자.
주요 특징
- 대규모 압축: 전체 모델은 ImageSAM3 대비 최대 90% 작습니다 (예: EV-M는 89.2M 파라미터).
- 유연한 아키텍처: RepViT, TinyViT, EfficientViT 등 다양한 경량 백본을 지원합니다.
- 증류된 텍스트 인코더: MobileCLIP을 통해 시각-언어 세그멘테이션 품질을 유지하도록 특별히 최적화된 텍스트 인코더.
- 배포 준비 완료: ONNX 및 TensorRT 내보내기를 지원하여 크로스플랫폼 배포가 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트