SimonZeng7108/efficientsam3
EfficientSAM3 compresses SAM3 into lightweight, edge-friendly models via progressive knowledge distillation for fast promptable concept segmentation and tracking.
解決的問題
EfficientSAM3 解決了 Segment Anything Model 3 (SAM3) 的高計算成本與大模型尺寸問題,使其更易於在資源受限的裝置上部署。在減少視覺與文字編碼器參數數量的同時,仍維持具競爭力的分割效能。
工作原理
本專案使用漸進式階層式知識蒸餾,將 SAM3 的重型編碼器壓縮為輕量級學生模型。提供兩種主要配置:
- EfficientSAM3 全模型:使用 EfficientViT、RepViT 或 TinyViT 替代視覺編碼器,使用 MobileCLIP 替代文字編碼器,與 ImageSAM3 相比,模型大小最多可減少 90%。
- SAM3-LiteText:保留原始 SAM3 的視覺編碼器,但將重型文字編碼器替換為輕量級 MobileCLIP 變體,使文字編碼器大小減少 88%。
適用對象
需要高品質影像與影片概念分割,但要求模型更小、更快、更高效以用於即時或邊緣部署的研究人員與開發者。
主要亮點
- 大幅壓縮:全模型比 ImageSAM3 最多小 90%(例如,EV-M 僅 89.2M 參數)。
- 靈活架構:支援多種輕量級骨幹網路,如 RepViT、TinyViT 與 EfficientViT。
- 蒸餾文字編碼器:透過 MobileCLIP 特別優化文字編碼器,以維持視覺-語言分割品質。
- 部署就緒:支援 ONNX 與 TensorRT 導出,適用於跨平台部署。
相關
- 專案
- 專案
- 專案
- 專案
- 專案