google-deepmind/videoprism
Official repository for "VideoPrism: A Foundational Visual Encoder for Video Understanding" (ICML 2024)
VideoPrism – 一般的用途を持つビデオエンコーダー
何であるか – VideoPrismは、ビデオ用のファウンデーションスタイルの視覚エンコーダーです。これはJAX/Flaxモデルであり、生のビデオクリップを豊かな空間時系列埋め込みに変換でき、クロスモーダル検索や関連タスク用のペアリングされたビデオ・テキストエンコーダーも同梱されています。
なぜ重要か – 著者たちは、膨大なハイブリッドデータセット(10億枚の画像・テキストペア、3600万件の高品質なビデオ・テキストペア、5億8200万件のノイズのあるビデオクリップ)でモデルを事前学習しました。単一のフリーズされたバックボーンで、33件のうち31件の公開ビデオ理解ベンチマークで最先端の結果を達成しています。分類、検索、局所化、キャプション、QAをカバーしています。
使い方 – パッケージのインストール後(pip install .)、ヘルパー関数 videoprism.models.get_model と load_pretrained_weights を使ってチェックポイントを読み込みます。READMEには2つの短いコードスニペットが記載されています:
import jax
from videoprism import models as vp
# ビデオ専用エンコーダー
model = vp.get_model('videoprism_public_v1_base')
state = vp.load_pretrained_weights('videoprism_public_v1_base')
@jax.jit
def encode(video):
return model.apply(state, video, train=False)
ビデオ・テキスト版の場合は、SentencePieceトークナイザー(c4_en)を読み込み、ビデオテンソルとトークン化されたテキストの両方をモデルに渡します。
事前作成されたデモ – リポジトリには以下の3つのColabノートブックが同梱されています:
- ビデオエンコーダーデモ – 生のビデオ → トークン埋め込み。
- ビデオ・テキストエンコーダーデモ – ゼロショット検索用の共同ビデオ・テキスト埋め込みを計算。
- ビデオ分類デモ – フリーズされたバックボーンの上に軽量なヘッドをファインチューニング。
リリースされたモデル – Hugging Faceに4つのチェックポイントファミリーが公開されています:
| バリアント | サイズ | パラメータ数 | 通常の入力 | チェックポイント |
|---|---|---|---|---|
| VideoPrism‑B(ベース) | 458 MB | 114 M | 16フレーム、288×288のクリップ | videoprism-base-f16r288 |
| VideoPrism‑L(ラージ) | 1.42 GB | 354 M | 8フレーム、288×288のクリップ | videoprism-large-f8r288 |
| VideoPrism‑LvT‑B(ビデオ・テキストベース) | 991 MB | 248 M | – | videoprism-lvt-base-f16r288 |
| VideoPrism‑LvT‑L(ビデオ・テキストラージ) | 2.30 GB | 580 M | – | videoprism-lvt-large-f8r288 |
パフォーマンスのハイライト(フリーズされたバックボーン) –
- VideoGLUE(分類、アクション検出など) – VideoPrism‑LはKinetics‑400で85.0 %、AVA‑Kで34.5 %を達成し、以前のSOTAを上回りました。
- ゼロショットビデオ・テキスト検索 – VideoPrism‑LvT‑LはVATEX(ビデオ→テキスト)で75.0 %のrecall@1、VATEX(テキスト→ビデオ)で57 %を達成しました。
- ゼロショットビデオ分類 – VideoPrism‑LvT‑LはK400で72.4 %を記録し、以前のベースラインを上回りました。
ロードマップ – 列挙された唯一のTODOはPyTorchサポートの追加であり、JAXエコシステム以外へのアクセスを広げるものです。
ライセンスと免責事項 – コードはApache 2.0、モデル重みおよびその他のアセットはCC‑BYです。リポジトリは、これはGoogleの公式製品ではありませんと明記しています。
結論 – VideoPrismは、研究者が最小限のファインチューニングで下流タスクに簡単に統合できる、準備完了の高容量ビデオエンコーダー(およびビデオ・テキストバージョン)を提供します。明確なColabノートブックと事前学習済みチェックポイントが付属しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト