google-deepmind/tapnet
Tracking Any Point (TAP)
何を解決するか
このプロジェクトは、「任意の点を追跡する」(TAP: Tracking Any Point) ための一連のツールとモデルを提供します。これにより、ビデオフレーム全体にわたって、固体の物理的表面上の追跡可能な任意の点を正確に追跡できます。従来のボックスやセグメントによるトラッキングとは異なり、TAPはポイントレベルの精度に焦点を当てており、クラス固有のトレーニングを必要とせずに、変形する表面や多様なオブジェクトの長期的なトラッキングを処理できます。
仕組み
このリポジトリは、進化し続けるいくつかのアーキテクチャを実装しています:
- TAPIR: 2段階のアルゴリズムで、まず各フレームでクエリポイントの候補となる一致点を独立して特定し、次にローカルな相関関係を使用して軌跡とクエリ特徴を洗練します。
- TAPNext / TAPNext++: ポイントトラッキングを次のトークン予測問題として定式化し、ネットワークを通じて情報を伝播させてポイントを追跡します。TAPNext++は、特に長期的なトラッキング、遮蔽、および再検出の安定性を向上させています。
- BootsTAP: 大規模でラベルなしの実世界のビデオデータセットを使用して、空間的な変換と破損に対して一貫性を強制することで精度を向上させるトレーニング手法です。
- TRAJAN: ポイント軌跡オートエンコーダーであり、一連のサポート軌跡に基づいて欠落しているポイント軌跡を再構成し、異なるビデオ間での動きのパターンの比較を可能にします。
対象者
- Computer Vision Researchers: ポイントトラッキング、オプティカルフロー、および動きの分析に取り組んでいる研究者。
- Robotics Engineers: RoboTAPを使用して、視覚的な模倣を通じて操作タスクを実行する開発者。
- AI Developers: ビデオ分析や生成ビデオの評価のために高精度なポイントトラッキングを必要とするすべての人。
ハイライト
- Multiple Benchmarks: 2Dおよび3Dのポイントトラッキング評価のための TAP-Vid, RoboTAP, および TAPVid-3D を含みます。
- Diverse Model Options: TAPIR, BootsTAPIR, および TAPNext を含む様々なチェックポイントを提供し、Jax と PyTorch の両方で実装されています。
- Real-time Capability: GPUプラットフォーム上でリアルタイムのトラッキングが可能な因果的 TAPIR モデルを含みます。
- Robotics Integration: RoboTAP を通 통해、実世界のロボット操作のためにポイントトラッキングを拡張しています。