google-deepmind/tapnet
Tracking Any Point (TAP)
What it solves
這項專案提供了一套用於「追蹤任何點」(TAP) 的工具與模型,能夠在影片幀之間精確地追蹤任何位於實體表面上的可追蹤點。與傳統的框選或分割追蹤不同,TAP 專注於點級別的精度,能夠處理變形表面,並在不需要特定類別訓練的情況下,跨不同對象進行長期追蹤。
How it works
此儲存庫實作了幾種不斷演進的架構:
- TAPIR: 一個兩階段演算法,首先在每一幀中獨立尋找查詢點的候選匹配點,然後使用局部相關性來精細化軌跡與查詢特徵。
- TAPNext / TAPNext++: 將點追蹤定義為下一個 token 預測問題,透過網路傳播資訊以追蹤點。TAPNext++ 特別針對長期追蹤、遮擋與重新偵測進行了穩定性提升。
- BootsTAP: 一種訓練方法,利用大型未標記的真實世界影片資料集,透過強制執行空間轉換與損壞後的數據一致性來提高精確度。
- TRAJAN: 一個點軌跡自動編碼器,能根據一組支持軌跡來重建重建缺失的點軌跡,從而實現不同影片間的運動模式比較。
Who it’s for
- Computer Vision Researchers: 致力於點追蹤、光流法與運動分析的研究人員。
- Robotics Engineers: 使用 RoboTAP 透過視覺模仿來執行操作任務的開發者。
- AI Developers: 需要在影片分析或生成式影片評估中進行高精度點追蹤的開發者。
Highlights
- Multiple Benchmarks: 包括 TAP-Vid, RoboTAP, 和 TAPVid-3D,用於 2D 與 3D 點追蹤評估。
- Diverse Model Options: 提供各種檢查點,包括 TAPIR, BootsTAPIR, 和 TAPNext, 並提供 Jax 和 PyTorch 的實作。
- Real-time Capability: 包括一個能夠在 GPU 平台上進行即時追蹤的因果 TAPIR 模型。
- Robotics Integration: 透過 RoboTAP 特別地將點追蹤擴展到真實世界的機器人操作任務中。