amanchadha/iSeeBetter

iSeeBetter: Spatio-Temporal Video Super Resolution using Recurrent-Generative Back-Projection Networks | Python3 | PyTorch | GANs | CNNs | ResNets | RNNs | Published in Springer Journal of Computational Visual Media, September 2020, Tsinghua University Press

해결하는 문제

iSeeBetter는 동영상 슈퍼리졸루션(VSR) 문제를 해결합니다. VSR의 목적은 저해상도 동영상을 고해상도로 업스케일링하는 것입니다. 단일 이미지 슈퍼리졸루션과 달리, 프레임 간 시간적 일관성이 부족해 깜빡임이나 불일치가 발생할 수 있으므로, iSeeBetter는 높은 시각적 품질과 세밀한 질감 세부 정보를 갖춘 시간적으로 일관된 동영상을 생성하는 것을 목표로 합니다.

작동 방식

이 프로젝트는 생성적 적대 신경망(GAN) 아키텍처를 사용합니다. 생성자는 현재 프레임(SISR)에서 공간 정보를, 인접 프레임(MISR)에서 시간 정보를 밀도 있는 운동 흐름 맵을 사용하여 추출하는 순환 백프로젝션 네트워크(RBPN)입니다. 이 통합된 정보는 순환 인코더-디코더 메커니즘을 통해 융합되며, 백프로젝션을 통해 추정된 프레임에 포함됩니다.

출력이 자연스럽고 아티팩트를 피하기 위해 SRGAN 아키텍처의 디스크리미네이터를 사용합니다. 모델은 다음 네 가지 손실 함수를 결합한 사중 손실 함수로 훈련됩니다:

  • MSE 손실: PSNR 및 SSIM 지표를 향상시킵니다.
  • 지각 손실: MSE가 놓칠 수 있는 세부 정보를 포착합니다.
  • 적대적 손실: 이미지의 "자연스러움"을 향상시킵니다.
  • 전체 변동(TV) 손실: 노이즈와 아티팩트를 줄입니다.

대상 사용자

컴퓨터 비전, 동영상 처리, 딥러닝 분야에서 일하는 연구자 및 개발자로, 최신 동영상 업스케일링 기술을 구현하거나 개선하고자 하는 분들입니다.

주요 특징

  • 공간-시간적 접근법: 현재 프레임과 인접 프레임을 활용하여 누락된 세부 정보를 복원합니다.
  • GAN 기반: 전통적인 CNN보다 지각적 품질을 향상시키기 위해 SRGAN 디스크리미네이터를 사용합니다.
  • 최고 수준의 성능: 공개 당시 PapersWithCode의 Video Super Resolution 리더보드에서 Vid4 4x 업스케일링에서 1위를 기록했습니다.
  • 포괄적인 손실 함수: 수학적 정확성과 시각적 현실감을 동시에 최적화하기 위해 네 가지 다른 손실 유형을 결합합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트