VicenteVivan/geo-clip

This is an official PyTorch implementation of our NeurIPS 2023 paper "GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization"

它解决了什么问题

GeoCLIP 解决了全球范围图像地理定位的难题——基于图像的视觉内容识别照片的确切地理位置。它还提供了一种将 GPS 坐标转换为语义丰富的向量表示(嵌入)的方法,这些表示可被其他 AI 模型使用。

它如何工作

受 OpenAI 的 CLIP 启发,GeoCLIP 在包含 470 万张图像-GPS 对的大规模数据集上使用对比学习。它将图像的视觉特征与地理坐标对齐,将地球视为一个连续函数,以学习与全球特定区域相关的独特视觉模式。

适用于谁

该工具专为构建地理感知神经架构或需要自动预测图像 GPS 坐标的开发人员和研究人员设计。

主要亮点

  • 全球定位:在 Im2GPS3k 和 GWS15k 等多个基准数据集上实现了最先进水平的结果。
  • GPS 编码器:包含一个预训练的位置编码器,可将纬度和经度转换为 512 维的嵌入向量。
  • 下游应用的通用性:学习到的 GPS 特征可与图像特征拼接,以提高地理标记数据集中的多类别分类准确率。

相关

  • 项目
  • 项目
  • 项目
  • 项目