google-deepmind/videoprism

Official repository for "VideoPrism: A Foundational Visual Encoder for Video Understanding" (ICML 2024)

VideoPrism – 一般的用途を持つビデオエンコーダー

何であるか – VideoPrismは、ビデオ用のファウンデーションスタイルの視覚エンコーダーです。これはJAX/Flaxモデルであり、生のビデオクリップを豊かな空間時系列埋め込みに変換でき、クロスモーダル検索や関連タスク用のペアリングされたビデオ・テキストエンコーダーも同梱されています。

なぜ重要か – 著者たちは、膨大なハイブリッドデータセット(10億枚の画像・テキストペア、3600万件の高品質なビデオ・テキストペア、5億8200万件のノイズのあるビデオクリップ)でモデルを事前学習しました。単一のフリーズされたバックボーンで、33件のうち31件の公開ビデオ理解ベンチマークで最先端の結果を達成しています。分類、検索、局所化、キャプション、QAをカバーしています。

使い方 – パッケージのインストール後(pip install .)、ヘルパー関数 videoprism.models.get_modelload_pretrained_weights を使ってチェックポイントを読み込みます。READMEには2つの短いコードスニペットが記載されています:

import jax
from videoprism import models as vp

# ビデオ専用エンコーダー
model = vp.get_model('videoprism_public_v1_base')
state = vp.load_pretrained_weights('videoprism_public_v1_base')

@jax.jit
def encode(video):
    return model.apply(state, video, train=False)

ビデオ・テキスト版の場合は、SentencePieceトークナイザー(c4_en)を読み込み、ビデオテンソルとトークン化されたテキストの両方をモデルに渡します。

事前作成されたデモ – リポジトリには以下の3つのColabノートブックが同梱されています:

  • ビデオエンコーダーデモ – 生のビデオ → トークン埋め込み。
  • ビデオ・テキストエンコーダーデモ – ゼロショット検索用の共同ビデオ・テキスト埋め込みを計算。
  • ビデオ分類デモ – フリーズされたバックボーンの上に軽量なヘッドをファインチューニング。

リリースされたモデル – Hugging Faceに4つのチェックポイントファミリーが公開されています:

バリアント サイズ パラメータ数 通常の入力 チェックポイント
VideoPrism‑B(ベース) 458 MB 114 M 16フレーム、288×288のクリップ videoprism-base-f16r288
VideoPrism‑L(ラージ) 1.42 GB 354 M 8フレーム、288×288のクリップ videoprism-large-f8r288
VideoPrism‑LvT‑B(ビデオ・テキストベース) 991 MB 248 M videoprism-lvt-base-f16r288
VideoPrism‑LvT‑L(ビデオ・テキストラージ) 2.30 GB 580 M videoprism-lvt-large-f8r288

パフォーマンスのハイライト(フリーズされたバックボーン)

  • VideoGLUE(分類、アクション検出など) – VideoPrism‑LはKinetics‑400で85.0 %、AVA‑Kで34.5 %を達成し、以前のSOTAを上回りました。
  • ゼロショットビデオ・テキスト検索 – VideoPrism‑LvT‑LはVATEX(ビデオ→テキスト)で75.0 %のrecall@1、VATEX(テキスト→ビデオ)で57 %を達成しました。
  • ゼロショットビデオ分類 – VideoPrism‑LvT‑LはK400で72.4 %を記録し、以前のベースラインを上回りました。

ロードマップ – 列挙された唯一のTODOはPyTorchサポートの追加であり、JAXエコシステム以外へのアクセスを広げるものです。

ライセンスと免責事項 – コードはApache 2.0、モデル重みおよびその他のアセットはCC‑BYです。リポジトリは、これはGoogleの公式製品ではありませんと明記しています。


結論 – VideoPrismは、研究者が最小限のファインチューニングで下流タスクに簡単に統合できる、準備完了の高容量ビデオエンコーダー(およびビデオ・テキストバージョン)を提供します。明確なColabノートブックと事前学習済みチェックポイントが付属しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト