taco-group/SparkVSR

[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation

What it solves

SparkVSR은 사용자가 아티팩트를 수정하거나 출력을 제어할 পারে 없는 기존의 비디오 초해상도 (VSR) 모델의 "블랙박스" 특성을 해결합니다. 소수의 고품질 키프레임을 사용하여 복원 프로세스를 가이드할 수 있는 대화형 프레임워크를 제공하여, 최종 비디오가 높은 시각적 품질을 유지하면서도 원래의 움직임을 유지하도록 보장합니다.

How it works

SparkVSR은 CogVideoX1.5-5B-I2V 베이스 모델을 기반으로 구축된 2단계 학습 파이프라인을 사용합니다:

  1. Stage-1 (Latent-Space): 모델은 저해상도 (LR) 비디오 잠재 공간 (latents)과 희소한 고해상도 (HR) 키프레임 잠재 공간 (latents)을 융합하여 강력한 교차 공간 전파를 가능하게 합니다.
  2. Stage-2 (Pixel-Space): 모델은 픽셀 공간에서 지각적 세부 사항을 정교화하여 출력이 제공된 키프레임을 준수하도록 보장하는 동시에, 참조가 없을 때 "blind" 복원을 수행할 수 있는 능력을 유지합니다.

추론 시, 시스템은 세 가지 모드를 지원합니다: 상용 API (예: nano-banana-pro)를 사용하여 키프레임을 생성하거나, 오픈소스 PiSA-SR 모델을 사용하거나, 또는 참조 없는 모드 (reference-free mode)를 지원합니다.

Who it’s for

비디오 복원, 오래된 필름 복원, 비디오 스타일 전송 작업을 수행하며 제어 가능한 고품질 업스케일링이 필요한 연구자 및 개발자.

Highlights

  • Interactive Control: 희소한 키프레임을 표현력 있는 제어 신호로 사용하여 초해상도 프로세스를 가이드합니다.

  • Flexible Reference Modes: 상용 API, 오픈소스 모델, 및 참조 없는 폴백 모드를 포함한 다양한 키프레임 소스를 지원합니다.

  • Coutrollable Adherence: 모델이 제공된 키프레임을 얼마나 엄격하게 따를지 조정하는 가이드 스케일 (guidance scale)이 포함되어 있습니다.

  • Broad Applicability: VSR 이외의 작업, 예를 들어 스타일 전송 및 오래된 필름 복원과 같은 작업에 적용할 수 있습니다.

  • ComfyUI Integration: 더 유연하고 노드 기반의 추론을 위해 ComfyUI 구현을 제공합니다.