amanchadha/iSeeBetter
iSeeBetter: Spatio-Temporal Video Super Resolution using Recurrent-Generative Back-Projection Networks | Python3 | PyTorch | GANs | CNNs | ResNets | RNNs | Published in Springer Journal of Computational Visual Media, September 2020, Tsinghua University Press
何を解決するか
iSeeBetterは、動画スーパーレゾリューション(VSR)の問題に対処します。VSRの目的は、低解像度の動画を高解像度にアップスケーリングすることです。単一画像のスーパーレゾリューションとは異なり、フレーム間の時間的一貫性が欠ける(フレッシャーまたは不整合)問題が生じるため、iSeeBetterは高視覚品質と細かいテクスチャの詳細を備えた時間的に一貫した動画を生成することを目指しています。
仕組み
このプロジェクトは、生成的対抗ネットワーク(GAN)アーキテクチャを使用しています。ジェネレータは、現在のフレーム(SISR)から空間情報を、隣接フレーム(MISR)から時間情報を、密な運動フロー地図を用いて抽出する再帰的バックプロジェクションネットワーク(RBPN)です。この統合情報は、再帰的エンコーダデコーダ機構を通じて融合され、バックプロジェクションによって推定フレームに組み込まれます。
出力が自然に見え、アーティファクトを避けるために、SRGANアーキテクチャのディスクリミネータを使用しています。モデルは、以下の4つの損失関数を組み合わせた四重損失関数で訓練されます:
- MSE損失:PSNRおよびSSIM指標を向上させます。
- 知覚損失:MSEが見逃す細かい詳細を捉えます。
- 敵対的損失:画像の「自然さ」を向上させます。
- 全変動(TV)損失:ノイズとアーティファクトを低減します。
対象ユーザー
コンピュータビジョン、動画処理、ディープラーニングに取り組む研究者や開発者で、最先端の動画アップスケーリング技術を実装または改善したい方。
特徴
- 空間時間的アプローチ:現在のフレームと隣接フレームを活用して、欠落した詳細を回復します。
- GANベース:SRGANディスクリミネータを使用して、従来のCNNよりも知覚品質を向上させます。
- 最先端のパフォーマンス:公開時の時点で、PapersWithCodeのVideo Super ResolutionリーダーボードでVid4 4xアップスケーリングで1位にランクインしました。
- 包括的な損失関数:数学的正確性と視覚的リアリズムの両方を最適化するため、4種類の異なる損失タイプを組み合わせています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト