EvolvingLMMs-Lab/LLaVA-OneVision-2
Fully Open Framework for Democratized Multimodal Training
解决的问题
LLaVA-OneVision-2 是一个旨在在单一架构内统一图像、长视频和空间理解的多模态模型。它解决了大多数开源多模态模型局限于 2D 单图像任务,或因上下文窗口限制和低效的令牌使用而在长视频处理上表现不佳的局限性。
工作原理
该项目利用“编解码器对齐”视觉编码器(OneVision-Encoder),模拟 HEVC 视频压缩。它不采用均匀采样帧,而是保留密集的 I 帧,并仅从 P 帧中选择运动和残差丰富的补丁。这使得模型在相同的令牌预算内能够覆盖标准采样三倍的时间范围。
关键在于,该模型对所有模态——图像、均匀帧和编解码器对齐令牌——使用单一的统一编码器,并采用共享位置方案,从而消除了对特定任务适配器或独立分词器的需求。训练遵循四阶段课程:引导视频能力、指令微调、扩展至长视频以及优化空间与跟踪技能。
适用人群
该项目面向需要高性能、完全开源的多模态模型的 AI 研究人员和开发者,该模型能够对长视频进行推理、理解 3D 感知的空间布局,并处理高分辨率文档和 OCR。
亮点
- 统一架构:一个无需特定任务适配器的 8B 模型,可处理图像、长视频和空间推理。
- 编解码器对齐编码:通过关注运动丰富的补丁高效处理长视频,增加时间覆盖范围。
- 完全开源:发布整个流水线,包括编码器权重、训练代码、配置和完整训练日志。
- 综合数据集:包含用于密集视频字幕和 3D 感知空间推理的专用数据集。
相关
- 项目
- 项目
- 项目
- 项目
- 项目