UCSC-VLAA/OpenVision

OpenVision (ICCV 2025), OpenVision 2 (CVPR 2026), and OpenVision 3

解決的問題

OpenVision 提供一組專為多模態學習設計的開源視覺編碼器。它透過提供更高效的訓練目標與可擴展的架構,解決高階視覺編碼器訓練成本高、複雜度高的問題,同時在 OCR、TextVQA 和 ChartQA 等基準測試中維持或提升性能。

工作原理

此專案經歷了三個版本的演進:

  • OpenVision(原始版):結合對比學習(CLIP 風格)與生成式(圖像描述)訓練目標。
  • OpenVision 2:透過移除文字編碼器與對比損失,簡化流程,僅依賴純圖像描述的自回歸生成目標。採用雙階段訓練(低解析度至高解析度)、來自 ReCap-DataComp-1B v2 的合成描述,以及視覺標記遮蔽,顯著降低記憶體佔用與訓練時間。
  • OpenVision 3:一個統一的視覺編碼器,能同時處理理解與生成任務。

適用對象

主要面向需要高效率視覺編碼器及訓練/微調基礎設施的 AI 研究人員與開發者,特別是使用 Google Cloud TPU 基礎設施的使用者。

主要亮點

  • 顯著的效率提升:相比原始版本,OpenVision 2 將訓練時間縮短 1.5–2 倍,記憶體使用量減少約 1.8 倍。
  • TPU 優化:專為 Google Cloud TPU 訓練優化,支援模型分片。
  • 可擴展架構:支援多種 ViT 模型尺寸,可擴展至 10 億以上參數。
  • 完整的模型庫:提供多種解析度與補丁大小的預訓練權重。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案