microsoft/XPretrain
Multi-modality pre-training
XPretrain – Microsoft Research によるマルチモーダル事前学習
概要 – XPretrain は、video-language(動画と言語)および image-language(画像と言語)のペアを用いた大規模な事前学習のための、研究用コードとデータセットのコレクションです。これは、トップカンファレンス(CVPR 2022, NeurIPS 2022, ICLR 2023)で発表された複数のモデルと、それに付随する HD-VILA-100M データセットをまとめたもので、すべて Microsoft の Multimedia Search & Mining (MSM) グループによるものです。
主要コンポーネント
| Modality | Model / Dataset | Paper (venue) | What it does |
|---|---|---|---|
| Video-Language | HD-VILA | CVPR 2022 | 100 M-clip HD-VILA-100M データセットを用いた高解像度 video-language 事前学習 |
| Video-Language | LF-VILA | NeurIPS 2022 | 長尺動画(数分間)での事前学習 |
| Video-Language | CLIP-ViP | ICLR 2023 | テンポラル・プーリング・モジュールを追加することで、image-language CLIP パラダイムを動画に適合させる |
| Image-Language | Pixel-BERT | arXiv 2020 | 生のピクセルから学習される end-to-end image-language transformer |
| Image-Language | SOHO | CVPR 2021 (oral) | 量子化されたビジュアル・トークンを用いて Pixel-BERT を改善 |
| Image-Language | VisualParsing | NeurIPS 2021 | 解析目的関数を用いた Transformer ベースの image-language 事前学習 |
入手可能なもの
- Code:各モデルのコード(学習スクリプト、モデル定義、評価ユーティリティ)がサブフォルダ(
hd-vila/,LF-VILA/,CLIP-ViP/, など)に格納されています。 - Pre-trained checkpoints:論文とともに公開されている、video captioning、video-question answering、image-text retrieval など、ダウンストリーム・タスクへのファインチューニングが可能なチェックポイントです。
- HD-VILA-100M dataset:大規模な事前学習のために公開された、高解像度 video-text ペアのコレクションです。
典型的なユースケース
- 新しい video-language モデルを構築する研究者は、公開されたチェックポイントから開始し、独自のデータでファインチューニングを行うことができます。
- 動画検索、キャプション生成、またはマルチモーダル検索などのタスクに強力な video-text エンコーダーを必要とする実務家。
- 解像度、時間的長さ、またはトークン量子化がマルチモーダル学習に与える影響を研究する学者。
はじめに
- リポジトリをクローン:
git clone https://github.com/microsoft/XPretrain.git。 - 必要な Python パッケージをインストール:
READMEは各サブフォルダ内のrequirements.txtを指しています。 - 各モデルのディレクトリにある README(例:
hd-vila/README.md)に従って、データの準備、学習、および推論コマンドを実行してください。 - データセットについては、
hd-vila-100m/フォルダ内の HD-VILA-100M ファイルをダウンロードしてください(リンクはそこに記載されています)。
コミュニティと貢献
- 貢献は Microsoft の CLA に基づいて受け入れられます。PR を作成すると、ボットがプロセスを案内します。
- 事前学習済みモデルに関するヘルプが必要な場合は、Issue を作成してください。直接的な質問については、著者 Bei Liu または Jianlong Fu に連絡してください。
なぜ重要なのか XPretrain は、いくつかの最先端のマルチモーダル事前学習パイプラインを一つの場所に集約しており、コミュニティが結果を再現、新しいアイデアをベンチマーク、および大規模な video-language 表記法を活用することを、大規模な学習インフラをゼロから構築することなく容易にしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト