NVlabs/AutoGaze
AutoGaze automatically removes redundant patches in a video, reducing #tokens in ViT/MLLM by 4x-100x.
解決的問題
視覺變換器(ViTs)與多模態 LLM 類型的影片理解模型,在處理高解析度、高幀率或長影片時,由於必須關注每一幀中的每一個補丁,因此成本極高。AutoGaze 透過自動選擇具資訊的補丁並捨棄冗餘補丁來解決此問題,使下游模型能以更少的標記進行處理,同時不損失資訊。這使得將影片模型擴展至 4K 解析度與 1K 幀影片成為可能。
工作原理
AutoGaze 是一種自回歸式的「凝視」模型:給定一個影片,它會逐個預測指向具資訊補丁的凝視位置序列,並利用這些位置構建一個精簡的標記集合。該模型使用強化學習(GRPO 或下一個標記預測)進行訓練,任務目標如 VideoMAE 重建,其中獎勵衡量所選補丁保留影片資訊的能力。README 描述了一個模組化程式碼庫,包含凝視模型、任務(例如影片 MAE 重建)、強化學習演算法、資料集與視覺編碼器(SigLIP 已經適應)。它也透過將 NVILA-8B 擴展為使用 AutoGaze 在其 SigLIP 編碼器與 LLM 之前修剪補丁的「HD-Video」變體,展示整合範例。
適用對象
致力於使用 ViTs 或多模態 LLM 實現高效影片理解的研究人員與工程師。特別適合在計算或記憶體限制下需要處理長時間高解析度影片的系統建構者,以及希望獲得即用型、可訓練的補丁選擇模組與整合範例的使用者。
亮點
- 自回歸地選擇具資訊的補丁並移除冗餘補丁,大幅減少下游模型的標記數量。
- 在不損失資訊的前提下,將 ViTs/MLLM 擴展至 4K 解析度與 1K 幀影片。
- 作為 CVPR 2026 精選論文發布(已接受 CVPR 2026)。
- 開源預訓練的 AutoGaze 模型、訓練資料,以及用於高解析度長影片問答的新 HLVid 基準。
- 提供模組化程式碼(模型、任務、強化學習演算法、視覺編碼器),便於輕鬆新增新任務與模型。
- 包含與 NVILA-8B-HD-Video 的整合範例及 SigLIP 適配指南。
相關
- 專案
- 專案
- 專案
- 專案