VicenteVivan/geo-clip
This is an official PyTorch implementation of our NeurIPS 2023 paper "GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization"
What it solves
GeoCLIPは、画像の内容に基づいて写真の正確な地理的位置を特定する、世界規模の画像ジオロケーションの難しさに取り組んでいます。また、GPS座標を、他のAIモデルで使用可能な意味的に豊かなベクトル表現(embeddings)に変換する方法も提供します。
How it works
OpenAIのCLIPに触発されたGeoCLIPは、470万組の画像とGPSのペアからなる大規模なデータセットを用いて、対照学習(contrastive training)を行っています。画像からの視覚的特徴を地理的な位置と整合させることで、地球を連続的な関数として扱い、地球の特定の領域に関連付けられた独特な視覚的パターンを学習します。
Who it’s for
このツールは、地理情報を認識するニューラルアーキテクチャや、画像のGPS座標を自動的に予測する必要があるアプリケーションを構築している研究者や開発者向けに設計されています。
Highlights
- Worldwide Localization: Im2GPS3kやGWS15kを含む複数のベンチマークデータセットにおいて、最先端(state-of-the-art)の結果を達成しています。
- GPS Encoder: 緯度と経度を512次元のembeddingsに変換する、学習済みの位置エンコーダーが含まれています。
- Downstream Versatility: 学習されたGPS特徴量は、画像の特徴量と結合することで、ジオタグ付きデータセットにおけるマルチクラス分類の精度を向上させることができます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト