UCSC-VLAA/OpenVision
OpenVision (ICCV 2025), OpenVision 2 (CVPR 2026), and OpenVision 3
解决的问题
OpenVision 提供了一组专为多模态学习设计的开源视觉编码器。它通过提供更高效的训练目标和可扩展的架构,解决了高级视觉编码器训练成本高、复杂度高的问题,同时在 OCR、TextVQA 和 ChartQA 等基准测试中保持或提升了性能。
工作原理
该项目经历了三个版本的演进:
- OpenVision(原始版):结合了对比学习(CLIP 风格)和生成式(图像描述)训练目标。
- OpenVision 2:通过移除文本编码器和对比损失,简化了流程,仅依赖纯图像描述的自回归生成目标。采用两阶段训练(低分辨率到高分辨率)、来自 ReCap-DataComp-1B v2 的合成描述,以及视觉标记掩码,显著降低内存占用和训练时间。
- OpenVision 3:一个统一的视觉编码器,能够同时处理理解与生成任务。
适用人群
主要面向需要高性能视觉编码器及训练/微调基础设施的 AI 研究人员和开发者,特别是使用 Google Cloud TPU 基础设施的用户。
主要亮点
- 显著的效率提升:相比原始版本,OpenVision 2 将训练时间缩短 1.5–2 倍,内存使用量减少约 1.8 倍。
- TPU 优化:专为 Google Cloud TPU 训练优化,支持模型分片。
- 可扩展架构:支持多种 ViT 模型尺寸,可扩展至 10 亿以上参数。
- 全面的模型库:提供多种分辨率和补丁大小的预训练权重。
相关
- 项目
- 项目
- 项目
- 项目
- 项目