google-deepmind/tapnet
Tracking Any Point (TAP)
TAP‑Netとは?
TAP‑Netは、Google DeepMindの研究プロジェクトである Tracking Any Point (TAP) のコードベースであり、ビデオ内の任意のピクセルレベルの点を追跡するという課題に取り組んでいます。従来のオブジェクトトラッキング(バウンディングボックス全体を追跡)やオプティカルフロー(短いウィンドウのみを対象)とは異なり、TAPは、単一のフレーム上の単一のクエリ点を受け取り、その点が変形する表面、遮蔽物、または長期間にわたって、他のすべてのフレームでどこに移動するか(または消失するか)を予測することをモデルに要求します。
リポジトリに含まれる主なコンポーネント
| コンポーネント | 機能 | 使用方法 |
|---|---|---|
| TAP‑Vid & TAPVid‑3D datasets | 実写および合成ビデオのグランドトゥルース・ポイントトラックを含む、大規模なベンチマーク・コレクション(2Dおよび3D)。 | データをダウンロードし、提供されている評価スクリプトを実行して、TAPタスクにおけるモデルの精度を測定します。 |
| TAPIR | 高速に動作し、TAP‑Vidにおいて最先端(SOTA)を記録している2段階のポイントトラッキングモデル(マッチング + 精緻化)。 | 学習済みチェックポイント(JAX & PyTorch)が提供されています。Colabノートブックまたはリアルタイムデモスクリプトから推論を実行できます。 |
| BootsTAPIR | TAPIRと同じアーキテクチャですが、大規模なラベルなしビデオを用いて自己教師ありの「ブートストラップ」損失で学習されており、精度が大幅に向上しています。 | 使用方法はTAPIRと同じです。BootsTAPIRのチェックポイントをロードするだけです。 |
| TAPNext / TAPNext++ | ポイントトラッキングを次トークン予測問題として扱う、より新しくシンプルなトラッカー。TAPNext++は、長期的な安定性、遮蔽への対応、および再検出機能を追加しています。 | 提供されているColabノートブック(JAX または PyTorch)またはオフラインデモから実行できます。 |
| RoboTAP | TAPIRのポイントトラックを、ロボット操作のための数ショットの視覚的模倣ポリシーに変換する方法を実証します。ロボット特有のデータセットとクラスタリングコードが含まれています。 | クラスタリングノートブックを使用して、ポイントトラックを模倣学習のためのアクション・プリミティブに変換します。 |
| TRAJAN | ポイントトラックのセットに対して潜在空間を学習する軌跡オートエンコーダー。運動分布の比較や、生成ビデオモデルの評価に有用です。 | TRAJANのColabデモを実行して、軌跡のエンコード/デコードを行います。 |
| Training scripts | オリジナルのTAP‑Netベースライン、および合成Kubricデータを用いたTAPIRのためのJAXベースのトレーニングパイプライン。 | tapnet/training のREADMEに従って、モデルの再現や自身のデータでのファインチューニングを行ってください。 |
クイックスタート
- Colabデモ – リポジトリには、すぐに実行可能な多数のノートブック(例:
torch_tapnextpp_demo.ipynb,tapir_demo.ipynb)が含まれています。Google Colabでそれらを開き、「すべてのセルを実行」を押すと、自分のビデオをアップロードして数秒でポイントの追跡を確認できます。 - ライブデモ – リポジトリをクローンし、
tapnetパッケージをインストールし、チェックポイント(例:causal_tapir_checkpoint.npy)をダウンロードして、python -m tapnet.live_demoを実行します。標準的なRTX 4000であれば、480×480フレームで約17 fpsが得られます。 - 評価 –
tapnet/tapvidおよびtapnet/tapvid3dフォルダを使用してベンチマークデータをダウンロードし、提供されているメトリックスクリプトを呼び出して、標準的な「AJ」(平均Jaccard)スコアを計算します。
なぜ重要なのか
- きめ細かな動きの理解 – ポイントレベルのトラッキングは、バウンディングボックスによるトラッキングよりも、モデルの幾何学的・動的な把握度をより精密に測定できる手法です。
- ロボティクスへの架け橋 – RoboTAPは、正確なポイントトラックが模倣学習に直接活用でき、視覚データをロボットの動作に変換できることを示しています。
- 研究プラットフォーム – このリポジトリは、データセット、学習済み重み(JAX + PyTorch)、トレーニングコード、および一連のデモをパッケージ化しており、ポイントトラッキングの実験やその上での開発を行いたい人にとってのワンストップ・ショップとなります。
READMEにリンクされているリソース
- プロジェクトウェブページ: TAP‑Vid, TAPIR, RoboTAP, BootsTAP, TAPVid‑3D, TAPNext, TRAJAN, TAPNext++
- 詳細な背景知識のためのブログ記事および論文リンク
- チェックポイントをダウンロードするためのHuggingFaceハブ
- 合成グランドトゥルース・トラックを生成するためのKubric可視化ノートブック
要約: TAP‑Netは、コンピュータビジョンとロボティクスに応用可能な、きめ細かなビデオトラッキングタスクである Tracking Any Point 問題のための、データセット、最先端モデル、トレーニングパイプライン、およびインタラクティブなデモを提供する、本格的な研究グレードのオープンソースプロジェクトです。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト