taco-group/SparkVSR

[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation

What it solves

SparkVSR 解決了傳統影片超解析度 (VSR) 模型「黑盒化」的問題,使用者無法修正偽影或控制輸出。它提供了一個互動式框架,允許使用者透過一組少量的、高品質的關鍵影格來引導還原過程,確保最終影片在保持高視覺品質的同時,仍能與原始動作保持一致。

How it works

SparkVSR 使用基於 CogVideoX1.5-5B-I2V 基礎模型的兩階段訓練流程:

  1. Stage-1 (Latent-Space): 模型學習將低解析度 (LR) 影片潛在空間 (latents) 與稀疏的高解析度 (HR) 關鍵影格潛在空間 (latents) 進行融合,以實現強健的跨空間傳播。
  2. Stage-2 (Pixel-Space): 模型在像素空間中細化感知細節,以確保輸出符合提供的關鍵影格,同時在缺乏參考時仍具備執行「盲」還原的能力。

在推理階段,系統支援三種模式:使用商業 API (例如 nano-banana-pro) 來生成關鍵影格、使用開源的 PiSA-SR 模型,或是參考無模式 (reference-free mode)。

Who it’s for

從事影片還原、老舊影片修復與影片風格轉移的研究人員與開發者,需要可控且高品質的放大技術。

Highlights

  • Interactive Control: 使用稀疏關鍵影格作為具備表現力的控制信號,來引導超解析度過程。
  • Flexible Reference Modes: 支援多種關鍵影格來源,包括商業 API、開源模型以及參考無模式的備援方案。
  • Coutrollable Adherence: 包含一個引導比例 (guidance scale) 來調整模型遵循提供的關鍵影格的嚴格程度。
  • Broad Applicability: 可應用於 VSR 之外的任務,例如風格轉移與老舊影片修復。
  • ComfyUI Integration: 提供 ComfyUI 實作,以實現更靈活、基於節點的推理過程。"},