amanchadha/iSeeBetter

iSeeBetter: Spatio-Temporal Video Super Resolution using Recurrent-Generative Back-Projection Networks | Python3 | PyTorch | GANs | CNNs | ResNets | RNNs | Published in Springer Journal of Computational Visual Media, September 2020, Tsinghua University Press

解決的問題

iSeeBetter 解決了視頻超解析度(VSR)的問題,其目標是將低解析度的視頻上採樣為高解析度版本。與單一影像超解析度不同,後者可能導致幀間時間不一致(閃爍或不一致),iSeeBetter 希望生成具有高感知品質與細緻紋理細節的時間一致視頻。

工作原理

此專案採用生成對抗網路(GAN)架構。生成器是一個循環後向投影網路(RBPN),它使用密集運動流圖從當前幀(SISR)提取空間資訊,並從鄰近幀(MISR)提取時間資訊。這些綜合資訊透過循環編碼器-解碼器機制融合,並透過後向投影整合到估計幀中。

為確保輸出自然且避免偽影,使用了 SRGAN 架構的判別器。模型採用四重損失函數進行訓練,結合了以下內容:

  • MSE 損失:提升 PSNR 和 SSIM 指標。
  • 感知損失:捕捉 MSE 可能遺漏的細節。
  • 對抗損失:增強影像的「自然性」。
  • 總變差(TV)損失:減少雜訊和偽影。

適用對象

從事電腦視覺、視頻處理和深度學習的研究人員與開發者,希望實現或改進最尖端的視頻上採樣技術。

主要亮點

  • 時空方法:利用當前幀與鄰近幀恢復遺失的細節。
  • 基於 GAN:使用 SRGAN 判別器,相比傳統 CNN 提升感知品質。
  • SOTA 性能:在論文發布時,於 PapersWithCode 的 Video Super Resolution 排行榜上,Vid4 4x 上採樣任務中排名第一。
  • 綜合損失函數:結合四種不同損失類型,兼顧數學準確性與視覺真實感。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案