tue-mps/eomt

[CVPR 2025 Highlight] Official code and models for Encoder-only Mask Transformer (EoMT).

解决的问题

EoMT 通过消除对复杂、任务特定的解码器或适配器的需求,简化了图像分割。它证明了一个普通的 Vision Transformer (ViT) 可以在无需通常由最先进方法所需的架构开销的情况下,实现高质量的分割。

工作原理

编码器-only 掩码 Transformer (EoMT) 重新利用预训练的 ViT,将图像块和分割查询共同作为 token 进行编码。通过将两者都视为同一 Transformer 架构中的 token,它消除了对独立解码器的需求,使模型能够直接从编码器输出分割掩码。

适用人群

从事图像分割(全景、实例、语义)的计算机视觉研究人员和开发者,希望获得更快、更简约的架构,同时保持高精度。

亮点

  • 极简架构:仅使用普通的 ViT,无需适配器或解码器。
  • 高性能:在精度上与 SOTA 方法相当,同时速度最快可达 4 倍(例如使用 ViT-L)。
  • 广泛兼容:支持 DINOv2 和 DINOv3 后端。
  • 多功能性:支持 COCO、ADE20K、Cityscapes 等数据集上的全景、实例和语义分割任务。
  • 集成便捷:可通过 Hugging Face Transformers 使用。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目