zju3dv/MatchAnything
Code for "MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training", TPAMI 2026.
MatchAnything – 通用跨模態影像匹配
能做什麼
- 學習單一模型,可找到來自 不同 視覺模態(例如 RGB 相片、紅外線、草圖、深度圖等)影像之間的對應關係。
- 模型在極大且多樣的資料集上進行預訓練,因此無需任務特定的微調即可「匹配任何影像」。
為何重要
- 傳統的影像匹配流程(如 SIFT、SuperPoint 等)僅在兩張影像屬於相同外觀領域時表現良好。在機器人、遙測、醫學影像與 AR 領域,感測器產生異質資料,因此需要跨模態匹配。
- 通用匹配器可減少為每對模態分別建構流程的工程工作量。
核心元件(如 README 所述)
- 大規模預訓練 – 研究團隊在多種模態的大量影像對上訓練網路,使其學習與模態無關的特徵。
- 通用匹配器架構 – 雖然 README 未詳述網路結構,但名稱暗示一個單一主幹,可輸出適用於任何模態對的密集描述子。
- 預訓練權重 – 已準備好的模型托管於 Hugging Face,使用者可立即執行推論。
- 示範 – 一個互動式 Hugging Face Space 允許使用者上傳兩張不同類型的影像,並即時查看匹配結果。
如何開始
- 訪問 README 中連結的 Hugging Face 示範,無需安裝任何內容即可試用模型。
- 克隆程式碼庫,並在訓練程式碼釋出後遵循(未來的)訓練說明。
- 使用提供的預訓練權重(可在 Hugging Face 的
third_party/MatchAnything資料夾中取得)在自己的影像對上執行推論。
目標使用者
- 需要即插即用跨模態對應解決方案的研究人員與工程師。
- 建構機器人、無人機或 AR 裝置感知堆疊的開發者,這些裝置需融合來自多個感測器的資料。
論文與引用
- 此方法詳述於論文《MatchAnything: 基於大規模預訓練的通用跨模態影像匹配》(TPAMI 2026)。README 提供了引用用的 BibTeX 項目。
目前狀態
- 預訓練模型已公開可用。
- 訓練程式碼承諾於後續釋出。
以上所有資訊均直接取自程式碼庫的 README;未推測任何額外功能。
相關
- 專案
- 專案
- 專案
- Dispatch
- Dispatch