tue-mps/eomt
[CVPR 2025 Highlight] Official code and models for Encoder-only Mask Transformer (EoMT).
解決的問題
EoMT 透過消除對複雜、任務特定的解碼器或適配器的需求,簡化了影像分割。它證明了一個普通的 Vision Transformer (ViT) 可以在不需要通常由最尖端方法所需的架構開銷的情況下,實現高品質的分割。
工作原理
編碼器-only 掩碼 Transformer (EoMT) 重新利用預訓練的 ViT,將影像區塊與分割查詢共同作為 token 進行編碼。透過將兩者視為同一 Transformer 架構中的 token,它消除了對獨立解碼器的需求,使模型能直接從編碼器輸出分割遮罩。
適用對象
從事影像分割(全景、實例、語意)的電腦視覺研究人員與開發者,希望獲得更快、更簡約的架構,同時保持高準確度。
亮點
- 極簡架構:僅使用普通的 ViT,無需適配器或解碼器。
- 高性能量:在準確度上與 SOTA 方法相當,同時速度最快可達 4 倍(例如使用 ViT-L)。
- 廣泛相容:支援 DINOv2 和 DINOv3 後端。
- 多功能性:支援 COCO、ADE20K、Cityscapes 等資料集上的全景、實例和語意分割任務。
- 整合便捷:可透過 Hugging Face Transformers 使用。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案