UCSC-VLAA/OpenVision

OpenVision (ICCV 2025), OpenVision 2 (CVPR 2026), and OpenVision 3

해결하는 문제

OpenVision은 다중 모달 학습을 위한 오픈소스 비전 인코더 패밀리를 제공합니다. 고급 시각 인코더의 훈련 비용과 복잡성을 줄이기 위해 더 효율적인 훈련 목표와 확장 가능한 아키텍처를 제공하며, OCR, TextVQA, ChartQA와 같은 벤치마크에서 성능을 유지하거나 향상시킵니다.

작동 방식

이 프로젝트는 세 가지 버전을 거쳐 발전했습니다:

  • OpenVision (원본): 대조적(CLIP 스타일) 및 생성적(캡셔닝) 훈련 목표의 조합을 사용합니다.
  • OpenVision 2: 텍스트 인코더와 대조 손실을 제거하고 캡셔닝 전용 자기회귀 생성 목표에만 의존하여 과정을 단순화했습니다. 저해상도에서 고해상도로의 이중 단계 훈련, ReCap-DataComp-1B v2에서 생성한 합성 캡셔닝, 시각 토큰 마스킹을 활용하여 메모리 사용량과 훈련 시간을 줄였습니다.
  • OpenVision 3: 이해와 생성 작업을 모두 처리할 수 있도록 설계된 통합 시각 인코더입니다.

대상 사용자

주로 Google Cloud TPU 인프라를 사용하는 다중 모달 모델을 개발하는 AI 연구자 및 개발자에게 적합합니다. 고성능 비전 인코더와 이를 훈련하거나 피니튜닝할 수 있는 인프라가 필요한 분들께 적합합니다.

주요 특징

  • 매우 큰 효율성 향상: 원본 버전과 비교해 OpenVision 2는 훈련 시간을 1.5~2배 단축하고 메모리 사용량을 약 1.8배 줄였습니다.
  • TPU 최적화: Google Cloud TPU 훈련에 특화되어 있으며, 모델 샤딩을 지원합니다.
  • 확장 가능한 아키텍처: 다양한 ViT 크기를 지원하며, 10억 이상의 파라미터까지 확장 가능합니다.
  • 포괄적인 모델 저널: 다양한 해상도와 패치 크기에 맞는 풍부한 사전 학습된 가중치를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트