google-deepmind/tapnet
Tracking Any Point (TAP)
해결하는 문제
이 프로젝트는 "임의의 점 트래킹" (TAP: Tracking Any Point)을 위한 도구 및 모델 세트를 제공합니다. 이를 통해 비디오 프레임 전반에 걸쳐 고체 물리 표면 위의 추적 가능한 임의의 점을 정밀하게 추적할 수 있습니다. 전통적인 박스 또는 세그먼트 트래킹과 달리, TAP는 포인트 레벨의 정밀도에 집중하여 클래스별 학습 없이도 변형되는 표면과 다양한 객체의 장기 트래킹을 처리합니다.
작동 방식
이 저장소는 진화하는 여러 아키텍처를 구현합니다:
- TAPIR: 2단계 알고리즘으로, 먼저 모든 프레임에서 쿼리 포인트에 대한 후보 일치점을 독립적으로 찾은 다음, 로컬 상관관계를 사용하여 궤적과 쿼리 특징을 정밀화합니다.
- TAPNext / TAPNext++: 포인트 트래킹을 다음 토큰 예측 문제로 공식화하여 네트워크를 통해 정보를 전파하며 포인트를 추적합니다. TAPNext++는 특히 장기 트래킹, 폐쇄 및 재검출에 대한 안정성을 개선합니다.
- BootsTAP: 대규모 레이블이 없는 실제 비디오 데이터셋을 사용하여 공간적 변환 및 손상에 대한 일관성을 강제함으로써 정확도를 높이는 학습 방법입니다.
- TRAJAN: 포인트 궤적 오토인코더로, 일련의 지원 궤적을 기반으로 누락된 포인트 궤적을 재구성하여 서로 다른 비디오 간의 움직임 패턴을 비교할 수 있게 합니다.
대상 사용자
- Computer Vision Researchers: 포인트 트래킹, 광학 흐름 및 모션 분석을 연구하는 연구자.
- Robotics Engineers: RoboTAP을 사용하여 시각적 모방을 통해 조작 작업을 수행하는 개발자.
- AI Developers: 비디오 분석 또는 생성 비디오 평가를 위해 고정밀 포인트 트래킹이 필요한 모든 개발자.
주요 특징
- Multiple Benchmarks: 2D 및 3D 포인트 트래킹 평가를 위한 TAP-Vid, RoboTAP 및 TAPVid-3D를 포함합니다.
- Diverse Model Options: TAPIR, BootsTAPIR 및 TAPNext를 포함한 다양한 체크포인트를 제공하며, Jax 및 PyTorch 모두에서 구현됩니다.
- Real-time Capability: GPU 플랫폼에서 실시간 트래킹이 가능한 인과적 TAPIR 모델을 포함합니다.
- Robotics Integration: RoboTAP을 통해 실제 로봇 조작을 위해 포인트 트래킹을 확장합니다.