NVlabs/AutoGaze
AutoGaze automatically removes redundant patches in a video, reducing #tokens in ViT/MLLM by 4x-100x.
해결하는 문제
비디오 이해 모델(ViTs 및 멀티모달 LLM)은 고해상도, 고프레임레이트 또는 긴 비디오를 처리할 때 모든 프레임의 모든 패치에 주목해야 하므로 매우 비용이 많이 듭니다. AutoGaze는 정보가 있는 패치를 자동으로 선택하고 중복된 패치를 제거함으로써 이 문제를 해결합니다. 이를 통해 하류 모델은 정보 손실 없이 훨씬 적은 토큰만 처리할 수 있게 되며, 4K 해상도 및 1K 프레임 비디오로 모델을 확장하는 것이 가능해집니다.
작동 방식
AutoGaze는 자기회귀적인 '시선' 모델입니다. 비디오를 입력으로 받아, 정보가 있는 패치를 하나씩 가리키는 시선 위치의 시퀀스를 예측하고, 이를 바탕으로 축소된 토큰 세트를 구성합니다. 이 모델은 VideoMAE 재구성과 같은 작업 목표를 사용하여 강화학습(GRPO 또는 다음 토큰 예측)으로 훈련되며, 보상은 선택된 패치가 비디오의 정보를 얼마나 잘 유지하는지 측정합니다. README에는 시선 모델, 작업(예: 비디오 MAE 재구성), 강화학습 알고리즘, 데이터셋, 시각 인코더(SigLIP는 이미 적응됨)를 포함한 모듈식 코드베이스가 설명되어 있습니다. 또한, SigLIP 인코더와 LLM 전에 AutoGaze를 사용해 패치를 줄이는 NVILA-8B-HD-Video 버전을 확장하는 통합 예제도 제공됩니다.
대상 사용자
ViT 또는 멀티모달 LLM을 사용해 효율적인 비디오 이해를 연구하거나 개발하는 연구자 및 엔지니어입니다. 특히 계산 자원이나 메모리 제약 하에서 긴 고해상도 비디오를 처리해야 하는 시스템을 구축하는 사람들에게 특히 유용하며, 즉시 사용 가능한 트레이닝 가능한 패치 선택 모듈과 통합 예제도 필요로 하는 분들에게 적합합니다.
주요 특징
- 정보가 있는 패치를 자기회귀적으로 선택하고 중복된 패치를 제거하여 하류 모델의 토큰 수를 줄입니다.
- 정보 손실 없이 ViT/MLLM을 4K 해상도 및 1K 프레임 비디오로 확장할 수 있습니다.
- CVPR 2026 하이라이트 논문으로 공개됨(2026년 CVPR 채택).
- 사전 학습된 AutoGaze 모델, 학습 데이터, 고해상도 장시간 비디오 QA를 위한 새로운 HLVid 벤치마크를 오픈소스로 제공합니다.
- 모듈식 코드(모델, 작업, 강화학습 알고리즘, 시각 인코더)를 제공하여 새로운 작업과 모델을 쉽게 추가할 수 있습니다.
- NVILA-8B-HD-Video와의 통합 예제 및 SigLIP 적응 가이드를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트