taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
What it solves
SparkVSR 解決了傳統影片超解析度 (VSR) 模型「黑盒化」的問題,使用者無法修正偽影或控制輸出。它提供了一個互動式框架,允許使用者透過一組少量的、高品質的關鍵影格來引導還原過程,確保最終影片在保持高視覺品質的同時,仍能與原始動作保持一致。
How it works
SparkVSR 使用基於 CogVideoX1.5-5B-I2V 基礎模型的兩階段訓練流程:
- Stage-1 (Latent-Space): 模型學習將低解析度 (LR) 影片潛在空間 (latents) 與稀疏的高解析度 (HR) 關鍵影格潛在空間 (latents) 進行融合,以實現強健的跨空間傳播。
- Stage-2 (Pixel-Space): 模型在像素空間中細化感知細節,以確保輸出符合提供的關鍵影格,同時在缺乏參考時仍具備執行「盲」還原的能力。
在推理階段,系統支援三種模式:使用商業 API (例如 nano-banana-pro) 來生成關鍵影格、使用開源的 PiSA-SR 模型,或是參考無模式 (reference-free mode)。
Who it’s for
從事影片還原、老舊影片修復與影片風格轉移的研究人員與開發者,需要可控且高品質的放大技術。
Highlights
- Interactive Control: 使用稀疏關鍵影格作為具備表現力的控制信號,來引導超解析度過程。
- Flexible Reference Modes: 支援多種關鍵影格來源,包括商業 API、開源模型以及參考無模式的備援方案。
- Coutrollable Adherence: 包含一個引導比例 (guidance scale) 來調整模型遵循提供的關鍵影格的嚴格程度。
- Broad Applicability: 可應用於 VSR 之外的任務,例如風格轉移與老舊影片修復。
- ComfyUI Integration: 提供 ComfyUI 實作,以實現更靈活、基於節點的推理過程。"},