JingyunLiang/VRT
VRT: A Video Restoration Transformer (official repository)
VRT – Video Restoration Transformer
何がそれか – VRT は論文「VRT: A Video Restoration Transformer」(arXiv 2201.12288) で説明された Video Restoration Transformer の研究用 PyTorch 実装です。動画スーパーレゾリューション、デブラー、ノイズ除去、フレーム補間、空間時間的スーパーレゾリューションなど、さまざまな動画修復タスクを扱います。
なぜ重要か – 伝統的な動画修復ネットワークはフレームを1つずつ処理する(再帰的)か、短いスライディングウィンドウを使うため、長距離の時間的情報を捉える能力に制限があります。VRT は Temporal Mutual Self-Attention(TMSA)機構を導入し、動きを同時に推定し、特徴を整列・融合することで、多くのフレーム間の相互作用を可能にしつつ、並列処理も維持しています。著者らは9つのベンチマークデータセットで最高水準の性能向上(最大 2.16 dB)を報告しています。
主な特徴(READMEに記載)
- マルチタスクモデル – 動画SR、デブラー、ノイズ除去、フレーム補間、空間時間SRのすべてに適用可能な単一のアーキテクチャ。
- 長距離時間モデリング – TMSAは動画を短いクリップに分割して相互自己注意を適用し、層間でシーケンスをシフトすることで、クリップ間の相互作用を可能にします。
- 並列ワーピング – さらに隣接フレームの情報を融合するための追加のワーピングブランチを備えています。
- 事前学習済み重み – GitHubの Releases ページで全タスク対応のダウンロード可能なモデルが提供されています。
- ベンチマークレベルの性能 – 動画SRで +0.33 – 0.51 dB、デブラーで +1.47 – 2.15 dB、ノイズ除去で +1.56 – 2.16 dB など、顕著な向上を達成。
- Colabデモ – 1クリックでGoogle Colabノートブックを実行可能。ローカルインストール不要。
クイックスタート(テスト用)
# リポジトリをクローンし、依存関係をインストール
git clone https://github.com/JingyunLiang/VRT
cd VRT
pip install -r requirements.txt # Python 3.8+, PyTorch >=1.9.1, CUDA 11.1推奨
# 例:6フレームの動画スーパーレゾリューション(REDS用モデル)
python main_test_vrt.py \
--task 001_VRT_videosr_bi_REDS_6frames \
--folder_lq testsets/REDS4/sharp_bicubic \
--folder_gt testsets/REDS4/GT \
--tile 40 128 128 \
--tile_overlap 2 20 20
スクリプトは自動的に必要な事前学習済みモデルとテストデータ(Vimeo-90Kテストセットを除く)をダウンロードします。GPUメモリ不足の場合は --tile を調整してください。小さいタイルはメモリ使用量を減らしますが、PSNRがわずかに低下する可能性があります。
学習(概要)
- データセット – READMEには各タスク(例:REDSは動画SR、Vimeo-90KはSR/BI/BD、DVD/GoProはデブラー、DAVISはノイズ除去など)の正確な学習・テスト分割が記載されています。
- LMDB変換 – 速度向上のため、著者らはKAIRツールボックスの
create_lmdb.pyスクリプトを使ってPNG画像シーケンスをLMDB形式に変換することを推奨しています。 - テスト用のデータセット準備不要 –
main_test_vrt.pyはテストセットを自動で取得します。
リソース
- 論文: https://arxiv.org/abs/2201.12288
- 補足PDF: https://github.com/JingyunLiang/VRT/releases/download/v0.0/VRT_supplementary.pdf
- 事前学習済みモデル & 視覚的結果: https://github.com/JingdongLiang/VRT/releases
- Colabデモ: https://colab.research.google.com/gist/JingyunLiang/deb335792768ad9eb73854a8efca4fe0#file-vrt-demo-on-video-restoration-ipynb
- 関連研究 – 著者らは、後続の Recurrent Video Restoration Transformer (RVRT) および以前の画像修復Transformer(SwinIR、HCFlow、MANetなど)も紹介しています。
引用
VRTを研究で使用する場合、元の論文(arXiv 2201.12288)を引用してください。READMEの Citation セクションにコピー可能なBibTeXエントリが用意されています。
ライセンス & 謝辞
リポジトリは LICENSE ファイルに記載されたライセンス(学術コードの標準)に基づいて公開されています。ETH Zurich Computer Vision Lab および Meta Inc. が支援機関として謝辞されています。
結論 – VRT は幅広い動画修復問題に対応する最先端のTransformerの完全なオープンソース実装です。即時実行可能な事前学習済みモデル、明確なテストスクリプト、研究者が結果を再現または独自の動画データで微調整できる十分なドキュメントを提供しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト