taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
What it solves
SparkVSR 解决了传统视频超分辨率 (VSR) 模型的“黑盒”性质,即用户无法纠正伪影或控制输出。它提供了一个交互式框架,允许用户通过一小组高质量的关键帧来引导还原过程,确保最终视频在保持高视觉质量的同时,仍能与原始运动保持一致。
How it works
SparkVSR 使用基于 CogVideoX1.5-5B-I2V 基础模型的两阶段训练流水线:
- Stage-1 (Latent-Space): 模型学习将低分辨率 (LR) 视频潜空间 (latents) 与稀疏的高分辨率 (HR) 关键帧潜空间 (latents) 进行融合,以实现鲁棒的跨空间传播。
- Stage-2 (Pixel-Space): 模型在像素空间中细化感知细节,以确保输出符合提供的关键帧,同时在缺乏参考时仍具备“盲”还原的能力。
在推理阶段,系统支持三种模式:使用商业 API (例如 nano-banana-pro) 来生成关键帧、使用开源的 PiSA-SR 模型,或使用无参考模式。
Who it’s for
从事视频还原、老旧影片修复和视频风格迁移的研究人员和开发者,需要可控、高质量的上采样技术。
Highlights
- Interactive Control: 使用稀疏关键帧作为具有表现力的控制信号来引导超分辨率过程。
- Flexible Reference Modes: 支持多种关键帧来源,包括商业 API、开源模型和无参考备选方案。
- Coutrollable Adherence: 包含一个引导比例 (guidance scale) 来调整模型遵循提供的关键帧的严格程度。
- Broad Applicability: 可应用于 VSR 之外的任务, such as 风格迁移和老旧影片修复。
- ComfyUI Integration: 提供 ComfyUI 实现,以实现更灵活、基于节点的推理。