JingyunLiang/VRT

VRT: A Video Restoration Transformer (official repository)

VRT – Video Restoration Transformer

무엇인가요 – VRT는 논문 "VRT: A Video Restoration Transformer" (arXiv 2201.12288) 에서 설명된 Video Restoration Transformer 의 연구용 PyTorch 구현입니다. 동영상 슈퍼리졸루션, 디블러링, 노이즈 제거, 프레임 보간, 공간-시간 SR 등 다양한 동영상 복원 작업을 처리합니다.

왜 중요한가요 – 기존의 동영상 복원 네트워크는 프레임을 하나씩 처리하거나 짧은 슬라이딩 윈도우를 사용하여 장거리 시간 정보를 포착하는 능력이 제한되어 있습니다. VRT는 Temporal Mutual Self-Attention (TMSA) 메커니즘을 도입하여, 여러 프레임 간의 움직임을 동시에 추정하고 특징을 정렬하며 정보를 융합하면서도 병렬 처리를 가능하게 합니다. 저자들은 9개의 벤치마크 데이터셋에서 최고 성능을 기록하며 최대 2.16 dB 의 향상을 보고했습니다.


주요 기능 (README에 기술됨)

  • 다중 작업 모델 – 동영상 SR, 디블러링, 노이즈 제거, 프레임 보간, 공간-시간 SR에 모두 적용 가능한 단일 아키텍처.
  • 장거리 시간 모델링 – TMSA는 동영상을 짧은 클립으로 나누어 상호 자기 주의를 적용한 후, 계층 간에 시퀀스를 이동시켜 클립 간 상호작용을 가능하게 합니다.
  • 병렬 왜곡 – 추가적인 왜곡 브랜치를 통해 인접 프레임 정보를 더욱 효과적으로 융합합니다.
  • 사전 학습된 가중치 – GitHub Releases 페이지에서 모든 지원 작업에 대한 다운로드 가능한 모델이 제공됩니다.
  • 벤치마크 수준의 성능 – 동영상 SR에서 +0.33 – 0.51 dB, 디블러링에서 +1.47 – 2.15 dB, 노이즈 제거에서 +1.56 – 2.16 dB 등 향상.
  • Colab 데모 – 1클릭으로 Google Colab 노트북을 실행 가능하며, 로컬 설치 없이 모델을 사용할 수 있습니다.

빠른 시작 (테스트 전용)

# 리포지토리 복제 및 종속성 설치
git clone https://github.com/JingyunLiang/VRT
cd VRT
pip install -r requirements.txt   # Python 3.8+, PyTorch >=1.9.1, CUDA 11.1 권장

# 예시: 6프레임 REDS 모델을 사용한 동영상 슈퍼리졸루션
python main_test_vrt.py \
  --task 001_VRT_videosr_bi_REDS_6frames \
  --folder_lq testsets/REDS4/sharp_bicubic \
  --folder_gt testsets/REDS4/GT \
  --tile 40 128 128 \
  --tile_overlap 2 20 20

스크립트는 자동으로 필요한 사전 학습된 모델과 테스트 데이터를 다운로드합니다 (Vimeo-90K 테스트 세트 제외). GPU 메모리 부족 시 --tile 값을 조정하세요. 작은 타일은 메모리 사용량을 줄이지만 PSNR가 약간 낮아질 수 있습니다.


학습 (개요)

  • 데이터셋 – README에는 각 작업(예: REDS는 동영상 SR, Vimeo-90K는 SR/BI/BD, DVD/GoPro는 디블러링, DAVIS는 노이즈 제거 등)에 대한 정확한 학습 및 테스트 분할이 나와 있습니다.
  • LMDB 변환 – 속도 향상을 위해, 저자들은 KAIR 툴박스의 제공된 create_lmdb.py 스크립트를 사용해 PNG 이미지 시퀀스를 LMDB 형식으로 변환하는 것을 권장합니다.
  • 테스트용 데이터셋 준비 불필요main_test_vrt.py 는 테스트 세트를 자동으로 다운로드합니다.

자원


인용

VRT를 연구에 사용할 경우, 원본 논문(arXiv 2201.12288)을 인용해 주세요. README의 Citation 섹션에는 복사 가능한 BibTeX 항목이 포함되어 있습니다.


라이선스 및 감사

리포지토리는 LICENSE 파일에 명시된 라이선스(학술 코드의 표준)에 따라 배포됩니다. ETH Zurich Computer Vision Lab 및 Meta Inc. 가 지원 기관으로 언급되어 있습니다.


결론 – VRT는 다양한 동영상 복원 문제에 적용 가능한 최첨단 Transformer의 완전한 오픈소스 구현입니다. 즉시 실행 가능한 사전 학습된 모델, 명확한 테스트 스크립트, 연구자가 결과를 재현하거나 자체 동영상 데이터로 모델을 미세 조정할 수 있도록 충분한 문서를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트