tue-mps/eomt

[CVPR 2025 Highlight] Official code and models for Encoder-only Mask Transformer (EoMT).

何を解決するか

EoMTは、複雑なタスク固有のデコーダーやアダプターの必要性を排除することで、画像セグメンテーションを簡素化します。これは、通常のVision Transformer (ViT)が、最先端の手法で一般的に求められるアーキテクチャのオーバーヘッドなしに、高品質なセグメンテーションを実行できることを示しています。

動作方法

エンコーダーのみのマスクトランスフォーマー (EoMT) は、事前に学習されたViTを再利用し、画像パッチとセグメンテーションクエリを同じトークンとして統合的にエンコードします。両者を同じトランスフォーマー構造内でトークンとして扱うことで、別個のデコーダーの必要性がなくなり、エンコーダーから直接セグメンテーションマスクを出力できるようになります。

対象ユーザー

パノプティック、インスタンス、セマンティックの画像セグメンテーションに取り組むコンピュータビジョンの研究者や開発者で、高速かつミニマルなアーキテクチャを求める人向けです。高精度を維持しつつ、従来の手法よりも高速です。

特徴

  • ミニマルなアーキテクチャ: アダプターもデコーダーも使用せず、単なるViTのみを使用。
  • 高いパフォーマンス: SOTA手法と同等の精度を達成しつつ、最大4倍の高速化(例:ViT-L)。
  • 広範な互換性: DINOv2およびDINOv3バックボーンと互換性あり。
  • 汎用性: COCO、ADE20K、Cityscapesなど、さまざまなデータセットでパノプティック、インスタンス、セマンティックセグメンテーションをサポート。
  • 統合性: Hugging Face Transformers経由で利用可能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト