VicenteVivan/geo-clip
This is an official PyTorch implementation of our NeurIPS 2023 paper "GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization"
解決的問題
GeoCLIP 解決了全球影像地理定位的難題——根據影像的視覺內容來辨識其精確的地理位置。它也提供了一種將 GPS 座標轉換為語意豐富的向量表示(embeddings)的方法,可供其他 AI 模型使用。
運作原理
GeoCLIP 受到 OpenAI 的 CLIP 啟發,在包含 470 萬組影像與 GPS 配對的龐大資料集上進行對比訓練。它將影像中的視覺特徵與地理位置對齊,將地球視為一個連續函數,以學習與地球上特定區域相關聯的獨特視覺模式。
適用對象
此工具專為建構具備地理感知神經架構,或需要自動預測影像 GPS 座標之應用程式的研究人員與開發者所設計。
亮點
- 全球定位:在包含 Im2GPS3k 與 GWS15k 在內的多個基準資料集上取得了最先進的成果。
- GPS 編碼器:包含一個預先訓練的位置編碼器,能將緯度與經度轉換為 512 維度的 embeddings。
- 下游多功能性:學習到的 GPS 特徵可與影像特徵串接,以提升地理標記資料集中多類別分類的準確度。
相關
- 專案
- 專案
- 專案
- 專案