zju3dv/MatchAnything

Code for "MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training", TPAMI 2026.

MatchAnything – 通用跨模態影像匹配

能做什麼

  • 學習單一模型,可找到來自 不同 視覺模態(例如 RGB 相片、紅外線、草圖、深度圖等)影像之間的對應關係。
  • 模型在極大且多樣的資料集上進行預訓練,因此無需任務特定的微調即可「匹配任何影像」。

為何重要

  • 傳統的影像匹配流程(如 SIFT、SuperPoint 等)僅在兩張影像屬於相同外觀領域時表現良好。在機器人、遙測、醫學影像與 AR 領域,感測器產生異質資料,因此需要跨模態匹配。
  • 通用匹配器可減少為每對模態分別建構流程的工程工作量。

核心元件(如 README 所述)

  1. 大規模預訓練 – 研究團隊在多種模態的大量影像對上訓練網路,使其學習與模態無關的特徵。
  2. 通用匹配器架構 – 雖然 README 未詳述網路結構,但名稱暗示一個單一主幹,可輸出適用於任何模態對的密集描述子。
  3. 預訓練權重 – 已準備好的模型托管於 Hugging Face,使用者可立即執行推論。
  4. 示範 – 一個互動式 Hugging Face Space 允許使用者上傳兩張不同類型的影像,並即時查看匹配結果。

如何開始

  1. 訪問 README 中連結的 Hugging Face 示範,無需安裝任何內容即可試用模型。
  2. 克隆程式碼庫,並在訓練程式碼釋出後遵循(未來的)訓練說明。
  3. 使用提供的預訓練權重(可在 Hugging Face 的 third_party/MatchAnything 資料夾中取得)在自己的影像對上執行推論。

目標使用者

  • 需要即插即用跨模態對應解決方案的研究人員與工程師。
  • 建構機器人、無人機或 AR 裝置感知堆疊的開發者,這些裝置需融合來自多個感測器的資料。

論文與引用

  • 此方法詳述於論文《MatchAnything: 基於大規模預訓練的通用跨模態影像匹配》(TPAMI 2026)。README 提供了引用用的 BibTeX 項目。

目前狀態

  • 預訓練模型已公開可用。
  • 訓練程式碼承諾於後續釋出。

以上所有資訊均直接取自程式碼庫的 README;未推測任何額外功能。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • Dispatch