google-deepmind/tapnet

Tracking Any Point (TAP)

해결하는 문제

이 프로젝트는 "임의의 점 트래킹" (TAP: Tracking Any Point)을 위한 도구 및 모델 세트를 제공합니다. 이를 통해 비디오 프레임 전반에 걸쳐 고체 물리 표면 위의 추적 가능한 임의의 점을 정밀하게 추적할 수 있습니다. 전통적인 박스 또는 세그먼트 트래킹과 달리, TAP는 포인트 레벨의 정밀도에 집중하여 클래스별 학습 없이도 변형되는 표면과 다양한 객체의 장기 트래킹을 처리합니다.

작동 방식

이 저장소는 진화하는 여러 아키텍처를 구현합니다:

  • TAPIR: 2단계 알고리즘으로, 먼저 모든 프레임에서 쿼리 포인트에 대한 후보 일치점을 독립적으로 찾은 다음, 로컬 상관관계를 사용하여 궤적과 쿼리 특징을 정밀화합니다.
  • TAPNext / TAPNext++: 포인트 트래킹을 다음 토큰 예측 문제로 공식화하여 네트워크를 통해 정보를 전파하며 포인트를 추적합니다. TAPNext++는 특히 장기 트래킹, 폐쇄 및 재검출에 대한 안정성을 개선합니다.
  • BootsTAP: 대규모 레이블이 없는 실제 비디오 데이터셋을 사용하여 공간적 변환 및 손상에 대한 일관성을 강제함으로써 정확도를 높이는 학습 방법입니다.
  • TRAJAN: 포인트 궤적 오토인코더로, 일련의 지원 궤적을 기반으로 누락된 포인트 궤적을 재구성하여 서로 다른 비디오 간의 움직임 패턴을 비교할 수 있게 합니다.

대상 사용자

  • Computer Vision Researchers: 포인트 트래킹, 광학 흐름 및 모션 분석을 연구하는 연구자.
  • Robotics Engineers: RoboTAP을 사용하여 시각적 모방을 통해 조작 작업을 수행하는 개발자.
  • AI Developers: 비디오 분석 또는 생성 비디오 평가를 위해 고정밀 포인트 트래킹이 필요한 모든 개발자.

주요 특징

  • Multiple Benchmarks: 2D 및 3D 포인트 트래킹 평가를 위한 TAP-Vid, RoboTAP 및 TAPVid-3D를 포함합니다.
  • Diverse Model Options: TAPIR, BootsTAPIR 및 TAPNext를 포함한 다양한 체크포인트를 제공하며, Jax 및 PyTorch 모두에서 구현됩니다.
  • Real-time Capability: GPU 플랫폼에서 실시간 트래킹이 가능한 인과적 TAPIR 모델을 포함합니다.
  • Robotics Integration: RoboTAP을 통해 실제 로봇 조작을 위해 포인트 트래킹을 확장합니다.