NVlabs/AutoGaze

AutoGaze automatically removes redundant patches in a video, reducing #tokens in ViT/MLLM by 4x-100x.

解决的问题

视频理解模型(ViTs 和多模态 LLM)在处理高分辨率、高帧率或长视频时,由于必须关注每一帧中的每一个补丁,因此成本极高。AutoGaze 通过自动选择信息丰富的补丁并丢弃冗余补丁来解决这一问题,使下游模型能够以更少的标记进行处理,而不会丢失信息。这使得将视频模型扩展到 4K 分辨率和 1K 帧视频成为可能。

工作原理

AutoGaze 是一个自回归的“凝视”模型:给定一个视频,它会逐个预测指向信息丰富补丁的凝视位置序列,并利用这些位置构建一个精简的标记集合。该模型使用强化学习(GRPO 或下一个标记预测)进行训练,任务目标如 VideoMAE 重建,其中奖励衡量所选补丁保留视频信息的能力。README 描述了一个模块化代码库,包含凝视模型、任务(例如视频 MAE 重建)、强化学习算法、数据集和视觉编码器(SigLIP 已经适配)。它还通过将 NVILA-8B 扩展为使用 AutoGaze 在其 SigLIP 编码器和 LLM 之前修剪补丁的“HD-Video”变体,展示了集成示例。

适用人群

致力于使用 ViTs 或多模态 LLM 实现高效视频理解的研究人员和工程师。特别适合那些在计算或内存受限条件下需要处理长时高分辨率视频的系统构建者,以及希望获得即用型、可训练的补丁选择模块和集成示例的用户。

亮点

  • 自回归地选择信息丰富的补丁并移除冗余补丁,显著减少下游模型的标记数量。
  • 在不丢失信息的前提下,将 ViTs/MLLM 扩展至 4K 分辨率和 1K 帧视频。
  • 作为 CVPR 2026 精选论文发布(已接受 CVPR 2026)。
  • 开源预训练的 AutoGaze 模型、训练数据,以及用于高分辨率长视频问答的新 HLVid 基准。
  • 提供模块化代码(模型、任务、强化学习算法、视觉编码器),便于轻松添加新任务和模型。
  • 包含与 NVILA-8B-HD-Video 的集成示例及 SigLIP 适配指南。

相关

  • 项目
  • 项目
  • 项目
  • 项目