UCSC-VLAA/OpenVision

OpenVision (ICCV 2025), OpenVision 2 (CVPR 2026), and OpenVision 3

解决的问题

OpenVision 提供了一组专为多模态学习设计的开源视觉编码器。它通过提供更高效的训练目标和可扩展的架构,解决了高级视觉编码器训练成本高、复杂度高的问题,同时在 OCR、TextVQA 和 ChartQA 等基准测试中保持或提升了性能。

工作原理

该项目经历了三个版本的演进:

  • OpenVision(原始版):结合了对比学习(CLIP 风格)和生成式(图像描述)训练目标。
  • OpenVision 2:通过移除文本编码器和对比损失,简化了流程,仅依赖纯图像描述的自回归生成目标。采用两阶段训练(低分辨率到高分辨率)、来自 ReCap-DataComp-1B v2 的合成描述,以及视觉标记掩码,显著降低内存占用和训练时间。
  • OpenVision 3:一个统一的视觉编码器,能够同时处理理解与生成任务。

适用人群

主要面向需要高性能视觉编码器及训练/微调基础设施的 AI 研究人员和开发者,特别是使用 Google Cloud TPU 基础设施的用户。

主要亮点

  • 显著的效率提升:相比原始版本,OpenVision 2 将训练时间缩短 1.5–2 倍,内存使用量减少约 1.8 倍。
  • TPU 优化:专为 Google Cloud TPU 训练优化,支持模型分片。
  • 可扩展架构:支持多种 ViT 模型尺寸,可扩展至 10 亿以上参数。
  • 全面的模型库:提供多种分辨率和补丁大小的预训练权重。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目