JingyunLiang/VRT

VRT: A Video Restoration Transformer (official repository)

VRT – Video Restoration Transformer

何がそれか – VRT は論文「VRT: A Video Restoration Transformer」(arXiv 2201.12288) で説明された Video Restoration Transformer の研究用 PyTorch 実装です。動画スーパーレゾリューション、デブラー、ノイズ除去、フレーム補間、空間時間的スーパーレゾリューションなど、さまざまな動画修復タスクを扱います。

なぜ重要か – 伝統的な動画修復ネットワークはフレームを1つずつ処理する(再帰的)か、短いスライディングウィンドウを使うため、長距離の時間的情報を捉える能力に制限があります。VRT は Temporal Mutual Self-Attention(TMSA)機構を導入し、動きを同時に推定し、特徴を整列・融合することで、多くのフレーム間の相互作用を可能にしつつ、並列処理も維持しています。著者らは9つのベンチマークデータセットで最高水準の性能向上(最大 2.16 dB)を報告しています。


主な特徴(READMEに記載)

  • マルチタスクモデル – 動画SR、デブラー、ノイズ除去、フレーム補間、空間時間SRのすべてに適用可能な単一のアーキテクチャ。
  • 長距離時間モデリング – TMSAは動画を短いクリップに分割して相互自己注意を適用し、層間でシーケンスをシフトすることで、クリップ間の相互作用を可能にします。
  • 並列ワーピング – さらに隣接フレームの情報を融合するための追加のワーピングブランチを備えています。
  • 事前学習済み重み – GitHubの Releases ページで全タスク対応のダウンロード可能なモデルが提供されています。
  • ベンチマークレベルの性能 – 動画SRで +0.33 – 0.51 dB、デブラーで +1.47 – 2.15 dB、ノイズ除去で +1.56 – 2.16 dB など、顕著な向上を達成。
  • Colabデモ – 1クリックでGoogle Colabノートブックを実行可能。ローカルインストール不要。

クイックスタート(テスト用)

# リポジトリをクローンし、依存関係をインストール
git clone https://github.com/JingyunLiang/VRT
cd VRT
pip install -r requirements.txt   # Python 3.8+, PyTorch >=1.9.1, CUDA 11.1推奨

# 例:6フレームの動画スーパーレゾリューション(REDS用モデル)
python main_test_vrt.py \
  --task 001_VRT_videosr_bi_REDS_6frames \
  --folder_lq testsets/REDS4/sharp_bicubic \
  --folder_gt testsets/REDS4/GT \
  --tile 40 128 128 \
  --tile_overlap 2 20 20

スクリプトは自動的に必要な事前学習済みモデルとテストデータ(Vimeo-90Kテストセットを除く)をダウンロードします。GPUメモリ不足の場合は --tile を調整してください。小さいタイルはメモリ使用量を減らしますが、PSNRがわずかに低下する可能性があります。


学習(概要)

  • データセット – READMEには各タスク(例:REDSは動画SR、Vimeo-90KはSR/BI/BD、DVD/GoProはデブラー、DAVISはノイズ除去など)の正確な学習・テスト分割が記載されています。
  • LMDB変換 – 速度向上のため、著者らはKAIRツールボックスの create_lmdb.py スクリプトを使ってPNG画像シーケンスをLMDB形式に変換することを推奨しています。
  • テスト用のデータセット準備不要main_test_vrt.py はテストセットを自動で取得します。

リソース


引用

VRTを研究で使用する場合、元の論文(arXiv 2201.12288)を引用してください。READMEの Citation セクションにコピー可能なBibTeXエントリが用意されています。


ライセンス & 謝辞

リポジトリは LICENSE ファイルに記載されたライセンス(学術コードの標準)に基づいて公開されています。ETH Zurich Computer Vision Lab および Meta Inc. が支援機関として謝辞されています。


結論 – VRT は幅広い動画修復問題に対応する最先端のTransformerの完全なオープンソース実装です。即時実行可能な事前学習済みモデル、明確なテストスクリプト、研究者が結果を再現または独自の動画データで微調整できる十分なドキュメントを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト