amanchadha/iSeeBetter

iSeeBetter: Spatio-Temporal Video Super Resolution using Recurrent-Generative Back-Projection Networks | Python3 | PyTorch | GANs | CNNs | ResNets | RNNs | Published in Springer Journal of Computational Visual Media, September 2020, Tsinghua University Press

解决的问题

iSeeBetter 解决了视频超分辨率(VSR)问题,其目标是将低分辨率视频上采样为高分辨率版本。与单图像超分辨率不同,后者可能导致帧间时间不一致(闪烁或不一致),iSeeBetter 旨在生成具有高感知质量与精细纹理细节的时间一致视频。

工作原理

该项目采用生成对抗网络(GAN)架构。生成器是一个循环后向投影网络(RBPN),它使用密集运动流图从当前帧(SISR)提取空间信息,并从邻近帧(MISR)提取时间信息。这些综合信息通过循环编码器-解码器机制融合,并通过后向投影整合到估计帧中。

为确保输出自然且避免伪影,使用了 SRGAN 架构的判别器。模型采用四重损失函数进行训练,结合了以下内容:

  • MSE 损失:提升 PSNR 和 SSIM 指标。
  • 感知损失:捕捉 MSE 可能遗漏的细节。
  • 对抗损失:增强图像的“自然性”。
  • 总变差(TV)损失:减少噪声和伪影。

适用人群

从事计算机视觉、视频处理和深度学习的研究人员与开发者,希望实现或改进最先进的视频上采样技术。

主要亮点

  • 时空方法:利用当前帧和相邻帧恢复缺失的细节。
  • 基于 GAN:使用 SRGAN 判别器,相比传统 CNN 提升感知质量。
  • SOTA 性能:在论文发布时,于 PapersWithCode 的 Video Super Resolution 排行榜上,Vid4 4x 上采样任务中排名第一。
  • 综合损失函数:结合四种不同损失类型,兼顾数学准确性与视觉真实感。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目