SimonZeng7108/efficientsam3

EfficientSAM3 compresses SAM3 into lightweight, edge-friendly models via progressive knowledge distillation for fast promptable concept segmentation and tracking.

何を解決するか

EfficientSAM3は、Segment Anything Model 3 (SAM3)の高い計算コストと大きなモデルサイズを軽減し、リソース制約のあるデバイスへの展開をより容易にします。視覚エンコーダーとテキストエンコーダーのパラメータ数を削減しつつ、競争力のあるセグメンテーション性能を維持します。

仕組み

このプロジェクトは、段階的階層的知識蒸留を用いて、SAM3の重いエンコーダーを軽量な学生モデルに圧縮します。主に以下の2つの構成を提供します:

  1. EfficientSAM3 Full Models:視覚エンコーダー(EfficientViT、RepViT、TinyViTを使用)とテキストエンコーダー(MobileCLIPを使用)の両方を置き換え、ImageSAM3と比較して最大90%のサイズ削減を実現します。
  2. SAM3-LiteText:元のSAM3の視覚エンコーダーを維持しつつ、重いテキストエンコーダーを軽量なMobileCLIPバージョンに置き換え、テキストエンコーダーのサイズを88%削減します。

対象ユーザー

リアルタイムまたはエッジデプロイ向けに、より小さく、速く、効率的なモデルを必要とする研究者や開発者。

特徴

  • 大幅な圧縮:フルモデルはImageSAM3と比較して最大90%小さく(例:EV-Mは89.2Mパラメータ)
  • 柔軟なアーキテクチャ:RepViT、TinyViT、EfficientViTなど複数の軽量バックボーンをサポート
  • 蒸留されたテキストエンコーダー:MobileCLIPを用いて視覚言語セグメンテーションの品質を維持するように特別に最適化されたテキストエンコーダー
  • デプロイ準備完了:ONNXおよびTensorRTエクスポートをサポートし、クロスプラットフォーム展開に対応

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト