EvolvingLMMs-Lab/LLaVA-OneVision-2

Fully Open Framework for Democratized Multimodal Training

解決的問題

LLaVA-OneVision-2 是一個旨在在單一架構內統一圖像、長影片和空間理解的多模態模型。它解決了大多數開源多模態模型侷限於 2D 單圖像任務,或因上下文窗口限制和低效的 token 使用而在長影片處理上表現不佳的侷限性。

運作原理

該專案利用「編解碼器對齊」視覺編碼器(OneVision-Encoder),模擬 HEVC 影片壓縮。它不採用均勻採樣幀,而是保留密集的 I 幀,並僅從 P 幀中選擇運動和殘差豐富的 patch。這使得模型在相同的 token 預算內能夠覆蓋標準採樣三倍的時長範圍。

關鍵在於,該模型對所有模態——圖像、均勻幀和編解碼器對齊 token——使用單一的統一編碼器,並採用共享位置方案,從而消除了對特定任務適配器或獨立分詞器的需求。訓練遵循四階段課程:引導影片能力、指令微調、擴展至長影片以及優化空間與追蹤技能。

適用人群

該專案面向需要高性能、完全開源的多模態模型的 AI 研究人員和開發者,該模型能夠對長影片進行推理、理解 3D 感知的空間佈局,並處理高分辨率文件和 OCR。

亮點

  • 統一架構:一個無需特定任務適配器的 8B 模型,可處理圖像、長影片和空間推理。
  • 編解碼器對齊編碼:通過關注運動豐富的 patch 高效處理長影片,增加時間覆蓋範圍。
  • 完全開源:發布整個流水線,包括編碼器權重、訓練代碼、配置和完整訓練日誌。
  • 綜合數據集:包含用於密集影片字幕和 3D 感知空間推理的專用數據集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案