Mark12Ding/SAM2Long
[ICCV 2025] SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
何を解決するか
SAM2Long は長期動画セグメンテーションにおける誤差の蓄積問題に対処します。標準的な SAM 2 では、長時間の動画でオブジェクトを追跡する際に、オブジェクトが隠蔽されたり再出現したりすると、追跡がずれたり失敗したりすることが多く、セグメンテーションマスクが時間とともに劣化します。
仕組み
トレーニング不要のメモリツリーを導入し、複数のセグメンテーション仮説を管理します。単一のメモリパスに依存するのではなく、動画の進行に伴い、最適でないパスを動的に削除することで、誤差の拡散リスクを低減し、隠蔽に対する耐性を高めます。
対象ユーザー
長期動画における高精度な追跡が必要な、動画オブジェクトセグメンテーション(VOS)に取り組むコンピュータビジョンの研究者や開発者。
主な特徴
- トレーニング不要: 追加のパラメータや再トレーニングを必要とせず、SAM 2 を強化します。
- 耐障害性のある追跡: 長時間の動画におけるオブジェクトの隠蔽や再出現を特に設計で対処します。
- パフォーマンス向上: SA-V や LVOS などのベンチマークにおいて、オリジナルの SAM 2 と比較して J & F スコアで顕著な改善を示します。
- 互換性: SAM 2 および SAM 2.1 のチェックポイント(Tiny、Small、Base+、Large など)のさまざまなバックボーンサイズと互換性があります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト