NVlabs/AutoGaze
AutoGaze automatically removes redundant patches in a video, reducing #tokens in ViT/MLLM by 4x-100x.
何を解決するか
ビデオ理解モデル(ViTs およびマルチモーダル LLM)は、高解像度、高フレームレート、または長時間のビデオを処理する場合、すべてのフレームのすべてのパッチに注目しなければならないため、非常に高コストになります。AutoGaze は、情報を含むパッチを自動的に選択し、冗長なものを削除することで、この問題に対処します。これにより、下流モデルは情報損失なしにはるかに少ないトークンを処理できるようになります。これにより、4K 解像度および 1K フレームのビデオへのスケーリングが可能になります。
仕組み
AutoGaze は自己回帰的な「注視」モデルです。ビデオを入力として、情報を含むパッチを1つずつ指す注視位置のシーケンスを予測し、それらを使ってトークンの削減されたセットを構築します。このモデルは、VideoMAE 再構成などのタスク目的を使用して強化学習(GRPO または次トークン予測)で訓練されます。報酬は選択されたパッチがビデオの情報をどれだけ保持しているかを測定します。README には、注視モデル、タスク(例:ビデオ MAE 再構成)、強化学習アルゴリズム、データセット、視覚エンコーダ(SigLIP はすでに適応済み)を含むモジュール構造のコードベースが記載されています。また、SigLIP エンコーダと LLM の前に AutoGaze を使ってパッチを削減する「HD-Video」バージョンの NVILA-8B をスケーリングする統合例も示されています。
対象ユーザー
ViT やマルチモーダル LLM を用いた効率的なビデオ理解に取り組んでいる研究者やエンジニア。特に、計算資源やメモリ制約下で長時間・高解像度ビデオを扱うシステムを構築したい人にとって特に有用です。また、即時利用可能なトレーニング可能なパッチ選択モジュールと統合例を求める人にも適しています。
特徴
- 情報を含むパッチを自己回帰的に選択し、冗長なものを削除することで、下流モデルのトークン数を削減します。
- 情報損失なしに ViT/MLLM を 4K 解像度および 1K フレームのビデオにスケーリングできます。
- CVPR 2026 のハイライト論文として公開(CVPR 2026 受理)。
- 事前学習済み AutoGaze モデル、学習データ、および高解像度長時間ビデオ QA のための新しい HLVid ベンチマークをオープンソース化。
- モジュール構造のコード(モデル、タスク、強化学習アルゴリズム、視覚エンコーダ)を提供し、新しいタスクやモデルの追加が容易です。
- NVILA-8B-HD-Video との統合例と SigLIP の適応ガイドを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト