taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
해결하는 문제
SparkVSR는 기존의 동영상 슈퍼레졸루션(VSR)이 '블랙박스' 성격을 띠어 사용자가 아티팩트를 수정하거나 복원 프로세스를 안내할 수 없는 문제를 해결합니다. 사용자가 소량의 고품질 키프레임을 제공함으로써 VSR을 인터랙티브한 프로세스로 전환하여 전체 동영상 시퀀스의 복원을 제어 가능하게 만듭니다.
작동 방식
SparkVSR는 CogVideoX1.5-5B-I2V 기반 모델을 기반으로 하는 두 단계 트레이닝 파이프라인을 사용합니다:
- 잠재공간 적응 (단계 1): 모델은 저해상도(LR) 동영상 잠재 표현과 희소하게 인코딩된 고해상도(HR) 키프레임 잠재 표현을 융합하여 동영상 전반에 걸쳐 세부 정보를 견고하게 전파할 수 있도록 학습합니다.
- 픽셀 공간 정제 (단계 2): 모델은 픽셀 공간에서 지각적 세부 정보를 정제하며, 제공된 키프레임에 부합하는 동시에 키프레임이 누락되거나 불완전할 경우에도 '블라인드' 복원을 수행할 수 있는 능력을 균형 있게 유지합니다.
추론 시, 사용자는 상용 API, 오픈소스 모델(PiSA-SR 등), 또는 레퍼런스 없는 모드를 통해 키프레임을 제공할 수 있습니다. 시스템은 이러한 고품질 사전 지식을 동영상 전체에 전파하면서 원본 LR 동영상의 움직임에 기반해 지침을 유지합니다.
대상 사용자
이 도구는 동영상 복원 작업에 종사하는 연구자 및 개발자, 그리고 오래된 필름 복원이나 동영상 스타일 전이와 같은 작업에서 제어 가능하고 고품질 확대가 필요한 크리에이터를 위한 것입니다.
주요 특징
- 인터랙티브 제어: 키프레임을 수동으로 지정하여 슈퍼레졸루션 프로세스를 안내할 수 있습니다.
- 유연한 레퍼런스 모드: API 기반, 모델 기반(PiSA-SR), 또는 레퍼런스 없는(블라인드 SR) 복원을 지원합니다.
- 시간적 일관성: 기존 베이스라인 대비 시간적 안정성과 복원 품질을 향상시킵니다.
- 일반화된 프레임워크: 단순 확대를 넘어서 스타일 전이, 오래된 필름 복원과 같은 작업에도 적용 가능합니다.
- ComfyUI 통합: 더 유연한 노드 기반 추론을 가능하게 하는 ComfyUI 구현이 포함되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트