SimonZeng7108/efficientsam3

EfficientSAM3 compresses SAM3 into lightweight, edge-friendly models via progressive knowledge distillation for fast promptable concept segmentation and tracking.

解决的问题

EfficientSAM3 解决了 Segment Anything Model 3 (SAM3) 的高计算成本和大模型尺寸问题,使其更易于在资源受限设备上部署。在减少视觉和文本编码器参数量的同时,保持了具有竞争力的分割性能。

工作原理

该项目使用渐进式分层知识蒸馏,将 SAM3 的重型编码器压缩为轻量级学生模型。提供两种主要配置:

  1. EfficientSAM3 全模型:使用 EfficientViT、RepViT 或 TinyViT 替换视觉编码器,使用 MobileCLIP 替换文本编码器,与 ImageSAM3 相比,模型大小最多可减少 90%。
  2. SAM3-LiteText:保留原始 SAM3 的视觉编码器,但将重型文本编码器替换为轻量级 MobileCLIP 变体,使文本编码器大小减少 88%。

适用人群

需要高质量图像和视频概念分割,但要求模型更小、更快、更高效以用于实时或边缘部署的研究人员和开发者。

主要亮点

  • 大幅压缩:全模型比 ImageSAM3 最多小 90%(例如,EV-M 仅 89.2M 参数)。
  • 灵活架构:支持多种轻量级骨干网络,如 RepViT、TinyViT 和 EfficientViT。
  • 蒸馏文本编码器:通过 MobileCLIP 特别优化文本编码器,以维持视觉-语言分割质量。
  • 部署就绪:支持 ONNX 和 TensorRT 导出,适用于跨平台部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目