OpenGVLab/VideoChat-Flash
[ICLR2026] VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling
解決的問題
VideoChat-Flash 解決了處理超長影片(最長可達三小時)時,仍能維持高推理速度與準確性的挑戰。它透過減少表示影片畫格所需的權杖數量,解決長上下文影片建模中的計算效率低下問題。
工作原理
此專案實作了一種分層壓縮架構,將每個影片畫格編碼為僅 16 個權杖。此方法使模型能處理高達 10,000 幀的龐大輸入,同時比先前版本快 5 到 10 倍。它基於影片編碼器(InternVideo)與大語言模型(Qwen)建構而成。
適用對象
適用於專注於長影片理解、時間定位與高效影片分析的多模態大語言模型(MLLM)研究人員與開發者。
主要亮點
- 超長上下文支援:可處理長達三小時的影片。
- 高效率:將畫格編碼為 16 個權杖,顯著提升推理速度。
- 強大的檢索性能:在 10,000 幀的「針堆中找針」評估中達成 99.1% 的準確率。
- 多樣化的模型選項:提供多種模型尺寸(2B 和 7B)以及針對超長影片輸入或短期時間理解的專用版本。
相關
- 專案
- 專案
- 專案
- 專案