zju3dv/MatchAnything

Code for "MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training", TPAMI 2026.

MatchAnything – 通用跨模态图像匹配

它能做什么

  • 学习一个单一模型,能够找到来自 不同 视觉模态(例如 RGB 图像、红外线、草图、深度图等)的图像之间的对应关系。
  • 该模型在非常大规模且多样化的数据集上进行了预训练,因此无需任务特定的微调即可实现「匹配任何图像」。

为何重要

  • 传统的图像匹配流水线(如 SIFT、SuperPoint 等)仅在两幅图像属于相同外观域时表现良好。在机器人、遥感、医学成像和 AR 领域,传感器产生异构数据,因此需要跨模态匹配。
  • 通用匹配器可减少为每对模态单独构建流水线的工程工作量。

核心组件(如 README 所述)

  1. 大规模预训练 – 作者在涵盖多种模态的大量图像对上训练网络,使其学习到与模态无关的特征。
  2. 通用匹配器架构 – 尽管 README 未详细说明网络结构,但名称暗示了一个单一主干网络,可输出适用于任意模态对的密集描述符。
  3. 预训练权重 – 已准备好的模型托管在 Hugging Face 上,用户可立即运行推理。
  4. 演示 – 一个交互式 Hugging Face Space 允许用户上传两种不同类型图像,并实时查看匹配结果。

如何开始

  1. 访问 README 中链接的 Hugging Face 演示,无需安装任何内容即可尝试该模型。
  2. 克隆仓库,并在训练代码发布后遵循(未来的)训练说明。
  3. 使用提供的预训练权重(可在 Hugging Face 的 third_party/MatchAnything 文件夹中获取)在自己的图像对上运行推理。

目标用户

  • 需要即插即用的跨模态对应解决方案的研究人员和工程师。
  • 构建机器人、无人机或 AR 设备感知堆栈的开发者,这些设备需要融合来自多个传感器的数据。

论文与引用

  • 该方法在论文《MatchAnything: 基于大规模预训练的通用跨模态图像匹配》(TPAMI 2026)中有详细描述。README 提供了引用用的 BibTeX 条目。

当前状态

  • 预训练模型已公开可用。
  • 训练代码承诺将在后续发布。

以上所有信息均直接取自仓库的 README;未推断任何额外功能。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • Dispatch