VicenteVivan/geo-clip
This is an official PyTorch implementation of our NeurIPS 2023 paper "GeoCLIP: Clip-Inspired Alignment between Locations and Images for Effective Worldwide Geo-localization"
해결하는 문제
GeoCLIP은 이미지의 시각적 콘텐츠를 기반으로 사진의 정확한 지리적 위치를 식별하는 세계적인 이미지 지오로컬라이제이션의 어려움을 해결합니다. 또한 GPS 좌표를 다른 AI 모델이 사용할 수 있는 의미적 풍부한 벡터 표현(임베딩)으로 변환하는 방법을 제공합니다.
작동 방식
OpenAI의 CLIP을 영감으로 삼아 GeoCLIP은 470만 개의 이미지-GPS 쌍으로 구성된 거대한 데이터셋에서 대조 학습을 사용합니다. 이는 이미지의 시각적 특징을 지리적 위치와 일치시켜 지구를 연속적인 함수로 간주하고 특정 지역과 관련된 독특한 시각적 패턴을 학습합니다.
대상 사용자
이 도구는 이미지의 GPS 좌표를 자동으로 예측해야 하는 지오인식 신경망 아키텍처나 애플리케이션을 개발하는 연구자 및 개발자들을 위한 것입니다.
주요 특징
- 세계적 로컬라이제이션: Im2GPS3k 및 GWS15k를 포함한 여러 벤치마크 데이터셋에서 최고 성능을 달성합니다.
- GPS 인코더: 위도와 경도를 512차원 임베딩으로 변환하는 사전 훈련된 위치 인코더를 포함합니다.
- 하류 유연성: 학습된 GPS 특징을 이미지 특징과 결합하여 지오태깅된 데이터셋에서 다중 클래스 분류 정확도를 향상시킬 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트