VicenteVivan/geo-clip

This is an official PyTorch implementation of our NeurIPS 2023 paper "GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization"

解決的問題

GeoCLIP 解決了全球影像地理定位的難題——根據影像的視覺內容來辨識其精確的地理位置。它也提供了一種將 GPS 座標轉換為語意豐富的向量表示(embeddings)的方法,可供其他 AI 模型使用。

運作原理

GeoCLIP 受到 OpenAI 的 CLIP 啟發,在包含 470 萬組影像與 GPS 配對的龐大資料集上進行對比訓練。它將影像中的視覺特徵與地理位置對齊,將地球視為一個連續函數,以學習與地球上特定區域相關聯的獨特視覺模式。

適用對象

此工具專為建構具備地理感知神經架構,或需要自動預測影像 GPS 座標之應用程式的研究人員與開發者所設計。

亮點

  • 全球定位:在包含 Im2GPS3k 與 GWS15k 在內的多個基準資料集上取得了最先進的成果。
  • GPS 編碼器:包含一個預先訓練的位置編碼器,能將緯度與經度轉換為 512 維度的 embeddings。
  • 下游多功能性:學習到的 GPS 特徵可與影像特徵串接,以提升地理標記資料集中多類別分類的準確度。

相關

  • 專案
  • 專案
  • 專案
  • 專案