zju3dv/MatchAnything
Code for "MatchAnything: Universal Cross-Modality Image Matching with Large-Scale Pre-Training", TPAMI 2026.
MatchAnything – 通用跨模态图像匹配
它能做什么
- 学习一个单一模型,能够找到来自 不同 视觉模态(例如 RGB 图像、红外线、草图、深度图等)的图像之间的对应关系。
- 该模型在非常大规模且多样化的数据集上进行了预训练,因此无需任务特定的微调即可实现「匹配任何图像」。
为何重要
- 传统的图像匹配流水线(如 SIFT、SuperPoint 等)仅在两幅图像属于相同外观域时表现良好。在机器人、遥感、医学成像和 AR 领域,传感器产生异构数据,因此需要跨模态匹配。
- 通用匹配器可减少为每对模态单独构建流水线的工程工作量。
核心组件(如 README 所述)
- 大规模预训练 – 作者在涵盖多种模态的大量图像对上训练网络,使其学习到与模态无关的特征。
- 通用匹配器架构 – 尽管 README 未详细说明网络结构,但名称暗示了一个单一主干网络,可输出适用于任意模态对的密集描述符。
- 预训练权重 – 已准备好的模型托管在 Hugging Face 上,用户可立即运行推理。
- 演示 – 一个交互式 Hugging Face Space 允许用户上传两种不同类型图像,并实时查看匹配结果。
如何开始
- 访问 README 中链接的 Hugging Face 演示,无需安装任何内容即可尝试该模型。
- 克隆仓库,并在训练代码发布后遵循(未来的)训练说明。
- 使用提供的预训练权重(可在 Hugging Face 的
third_party/MatchAnything文件夹中获取)在自己的图像对上运行推理。
目标用户
- 需要即插即用的跨模态对应解决方案的研究人员和工程师。
- 构建机器人、无人机或 AR 设备感知堆栈的开发者,这些设备需要融合来自多个传感器的数据。
论文与引用
- 该方法在论文《MatchAnything: 基于大规模预训练的通用跨模态图像匹配》(TPAMI 2026)中有详细描述。README 提供了引用用的 BibTeX 条目。
当前状态
- 预训练模型已公开可用。
- 训练代码承诺将在后续发布。
以上所有信息均直接取自仓库的 README;未推断任何额外功能。
相关
- 项目
- 项目
- 项目
- Dispatch
- Dispatch