UCSC-VLAA/OpenVision

OpenVision (ICCV 2025), OpenVision 2 (CVPR 2026), and OpenVision 3

何を解決するか

OpenVisionは、マルチモーダル学習向けに設計されたオープンソースのビジョンエンコーダーのファミリーを提供します。高度な視覚エンコーダーのトレーニングにかかる高コストと複雑さを軽減するため、より効率的なトレーニング目的とスケーラブルなアーキテクチャを提供し、OCR、TextVQA、ChartQAなどのベンチマークで性能を維持または向上させます。

仕組み

このプロジェクトは3つのバージョンにわたり進化してきました:

  • OpenVision(オリジナル):コントラスト型(CLIPスタイル)と生成型(キャプション作成)のトレーニング目的を組み合わせます。
  • OpenVision 2:テキストエンコーダーとコントラスト損失を削除し、キャプションのみの自己回帰生成目的に依存するように簡素化しました。低解像度から高解像度への2段階トレーニング、ReCap-DataComp-1B v2から得た合成キャプション、視覚トークンマスキングを活用してメモリ使用量とトレーニング時間を削減します。
  • OpenVision 3:理解と生成の両方のタスクを処理できる統合型のビジョンエンコーダーです。

対象ユーザー

主に、Google Cloud TPUインフラを活用するマルチモーダルモデルを開発するAI研究者や開発者向けです。高性能なビジョンエンコーダーと、それらをトレーニングまたはファインチューニングするためのインフラが必要な方々に最適です。

主な特徴

  • 大幅な効率向上:オリジナルバージョンと比較して、OpenVision 2はトレーニング時間を1.5~2倍短縮し、メモリ使用量を約1.8倍削減します。
  • TPU最適化:Google Cloud TPUトレーニングに特化しており、モデルシャーディングをサポートしています。
  • スケーラブルなアーキテクチャ:さまざまなViTサイズをサポートし、10億パラメータ以上までスケーリング可能。
  • 包括的なモデルズー:さまざまな解像度とパッチサイズに対応した豊富な事前学習済み重みを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト