tue-mps/eomt
[CVPR 2025 Highlight] Official code and models for Encoder-only Mask Transformer (EoMT).
何を解決するか
EoMTは、複雑なタスク固有のデコーダーやアダプターの必要性を排除することで、画像セグメンテーションを簡素化します。これは、通常のVision Transformer (ViT)が、最先端の手法で一般的に求められるアーキテクチャのオーバーヘッドなしに、高品質なセグメンテーションを実行できることを示しています。
動作方法
エンコーダーのみのマスクトランスフォーマー (EoMT) は、事前に学習されたViTを再利用し、画像パッチとセグメンテーションクエリを同じトークンとして統合的にエンコードします。両者を同じトランスフォーマー構造内でトークンとして扱うことで、別個のデコーダーの必要性がなくなり、エンコーダーから直接セグメンテーションマスクを出力できるようになります。
対象ユーザー
パノプティック、インスタンス、セマンティックの画像セグメンテーションに取り組むコンピュータビジョンの研究者や開発者で、高速かつミニマルなアーキテクチャを求める人向けです。高精度を維持しつつ、従来の手法よりも高速です。
特徴
- ミニマルなアーキテクチャ: アダプターもデコーダーも使用せず、単なるViTのみを使用。
- 高いパフォーマンス: SOTA手法と同等の精度を達成しつつ、最大4倍の高速化(例:ViT-L)。
- 広範な互換性: DINOv2およびDINOv3バックボーンと互換性あり。
- 汎用性: COCO、ADE20K、Cityscapesなど、さまざまなデータセットでパノプティック、インスタンス、セマンティックセグメンテーションをサポート。
- 統合性: Hugging Face Transformers経由で利用可能。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト