amanchadha/iSeeBetter
iSeeBetter: Spatio-Temporal Video Super Resolution using Recurrent-Generative Back-Projection Networks | Python3 | PyTorch | GANs | CNNs | ResNets | RNNs | Published in Springer Journal of Computational Visual Media, September 2020, Tsinghua University Press
解决的问题
iSeeBetter 解决了视频超分辨率(VSR)问题,其目标是将低分辨率视频上采样为高分辨率版本。与单图像超分辨率不同,后者可能导致帧间时间不一致(闪烁或不一致),iSeeBetter 旨在生成具有高感知质量与精细纹理细节的时间一致视频。
工作原理
该项目采用生成对抗网络(GAN)架构。生成器是一个循环后向投影网络(RBPN),它使用密集运动流图从当前帧(SISR)提取空间信息,并从邻近帧(MISR)提取时间信息。这些综合信息通过循环编码器-解码器机制融合,并通过后向投影整合到估计帧中。
为确保输出自然且避免伪影,使用了 SRGAN 架构的判别器。模型采用四重损失函数进行训练,结合了以下内容:
- MSE 损失:提升 PSNR 和 SSIM 指标。
- 感知损失:捕捉 MSE 可能遗漏的细节。
- 对抗损失:增强图像的“自然性”。
- 总变差(TV)损失:减少噪声和伪影。
适用人群
从事计算机视觉、视频处理和深度学习的研究人员与开发者,希望实现或改进最先进的视频上采样技术。
主要亮点
- 时空方法:利用当前帧和相邻帧恢复缺失的细节。
- 基于 GAN:使用 SRGAN 判别器,相比传统 CNN 提升感知质量。
- SOTA 性能:在论文发布时,于 PapersWithCode 的 Video Super Resolution 排行榜上,Vid4 4x 上采样任务中排名第一。
- 综合损失函数:结合四种不同损失类型,兼顾数学准确性与视觉真实感。
相关
- 项目
- 项目
- 项目
- 项目
- 项目