OpenImagingLab/FlashVSR
[CVPR 2026] Towards Real-Time Diffusion-Based Streaming Video Super-Resolution — An efficient one-step diffusion framework for streaming VSR with locality-constrained sparse attention and a tiny conditional decoder.
⚡ FlashVSR – 실시간 확산 기반 스트리밍 동영상 슈퍼리졸루션
무엇인가요
- 일반적으로 4배의 저해상도 동영상을 고해상도로 업스케일링하는 연구용 라이브러리로, 속도를 위해 극도로 증류된 확산 모델을 사용합니다.
- 저자들은 NVIDIA A100 1개로 768 × 1408 동영상에서 약 17 FPS를 달성했으며, 실시간(근접 실시간)으로 작동 가능한 최초의 확산 기반 VSR 시스템이라고 주장합니다.
왜 중요한가요
- 확산 모델은 뛰어난 시각적 품질을 제공하지만 일반적으로 동영상 처리에는 너무 느립니다. FlashVSR는 세 가지 기술적 속임수로 이 문제를 해결합니다:
- 3단계 증류 파이프라인 – 대규모 교사 모델을 훈련한 후, 프레임 단위로 처리 가능한 스트리밍 친화적인 학생 모델로 압축합니다.
- 국소 제약 스파스 어텐션 (LCSA) – 작은 공간-시간 이웃에만 주목하여 중복 계산을 줄이고, 훈련 시와 추론 시 해상도 간 격차를 좁힙니다.
- 초소형 조건부 디코더 – 전체 확산 디코더의 무거운 비용 없이 세부 사항을 효과적으로 복원하는 경량 재구성 헤드입니다.
- 대규모 훈련을 위한 새로운 VSR-120K 데이터셋(12만 개의 동영상, 18만 개의 이미지)이 제공됩니다.
주요 구성 요소
| 구성 요소 | 역할 |
|---|---|
| 3단계 증류 | 무거운 확산 교사 모델을 프레임 단위로 실행 가능한 스트리밍용 학생 모델로 변환합니다. |
| LCSA | 각 토큰이 근접한 픽셀/프레임만을 주시하는 스파스 어텐션 마스크로, FLOPs를 극적으로 줄입니다. |
| 초소형 조건부 디코더 | 증류된 잠재 표현을 받아 최종 고해상도 프레임을 생성하는 빠른 업샘플링 헤드입니다. |
| 블록 스파스 어텐션 백엔드 | 외부 라이브러리(MIT-HAN-Lab)로, LCSA에 필요한 커스텀 스파스 커널을 구현합니다. |
| VSR-120K 데이터셋 | 모델 훈련에 사용된 대규모이고 다양한 동영상-이미지 컬렉션; Hugging Face에서 공개됩니다. |
일반적인 워크플로우
- 설치 Python 패키지(
pip install -e .)와 필요한 Block-Sparse-Attention 라이브러리를 설치합니다. - 다운로드 Hugging Face에서 사전 학습된 가중치(v1.1이 추천되며 더 안정적)를 Git LFS로 다운로드합니다.
- 실행 저해상도 동영상 프레임 폴더에 대해 제공된 추론 스크립트(
infer_flashvsr_v1.1_full.py,*_tiny.py, 또는 긴 동영상용 변형) 중 하나를 실행합니다. - 스크립트는 증류된 확산 모델을 프레임 단위로 스트리밍 처리하고, 실시간으로 LCSA를 적용하며, 업스케일된 동영상을 출력합니다.
사용 사례
- 스트리밍 플랫폼용 4K/8K 영상의 빠르고 고품질 업스케일링이 필요한 콘텐츠 크리에이터.
- 업스케일된 동영상의 실시간 미리보기가 중요한 포스트 프로덕션 파이프라인.
- 효율적인 확산 모델, 스트리밍 동영상 처리, 또는 스파스 어텐션 메커니즘에 대한 연구.
설치 요약
# 리포지토리 클론
git clone https://github.com/OpenImagingLab/FlashVSR && cd FlashVSR
# conda 환경 생성 (Python 3.11)
conda create -n flashvsr python=3.11 && conda activate flashvsr
# 패키지 및 종속성 설치
pip install -e .
pip install -r requirements.txt
# Block-Sparse-Attention 설치 (리포지토리 외부)
git clone https://github.com/mit-han-lab/Block-Sparse-Attention && cd Block-Sparse-Attention
pip install packaging ninja
python setup.py install
GPU 주의: NVIDIA A100/A800(Ampere) 및 H200(Hopper)에서 테스트됨. 소비자용 RTX 40/50 카드에서의 성능은 공식적으로 문서화되지 않음.
추론 실행 예시
cd examples/WanVSR
# 먼저 Git LFS로 v1.1 가중치 다운로드 (README 참조)
python infer_flashvsr_v1.1_full.py # 전체 크기 디코더, 최고 품질
# 또는
python infer_flashvsr_v1.1_tiny.py # 초소형 디코더, 빠름, 약간 낮은 품질
스크립트는 자동으로 가중치 폴더(FlashVSR-v1.1/)를 찾고, 업스케일된 동영상을 출력합니다.
커뮤니티 및 생태계
- 여러 ComfyUI 래퍼가 존재하지만, 초기 버전은 LCSA 모듈을 누락시켜 품질 저하를 일으켰습니다.
- 제3자 클라우드 서비스(fal.ai, WaveSpeed AI, Segmind 등)가 모델을 호스팅하여 웹 기반 추론을 쉽게 제공합니다.
- 저자들은 프로젝트 페이지, Hugging Face 모델 리포지토리, 다운로드 가능한 데이터셋을 제공합니다.
인용
@article{zhuang2025flashvsr,
title={FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution},
author={Zhuang, Junhao and Guo, Shi and Cai, Xin and Li, Xiaohui and Liu, Yihao and Yuan, Chun and Xue, Tianfan},
journal={arXiv preprint arXiv:2510.12747},
year={2025}
}
결론: FlashVSR는 증류, 스파스 어텐션, 초소형 디코더를 결합하여 확산 기반 동영상 업스케일링을 인터랙티브 사용에 적합한 속도로 만든 진정한 최첨단 AI 프로젝트입니다. 고품질 실시간 동영상 슈퍼리졸루션이 필요한 누구에게나 적합하며, 효율적인 확산 아키텍처를 탐구하는 연구자들에게도 이상적인 도구입니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch