taco-group/SparkVSR

[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation

解决的问题

SparkVSR 解决了传统视频超分辨率(VSR)的「黑箱」特性,即用户无法纠正伪影或引导恢复过程的问题。它通过允许用户提供少量高质量的关键帧作为控制信号,将 VSR 转变为一个交互式过程,从而引导整个视频序列的恢复。

工作原理

SparkVSR 基于 CogVideoX1.5-5B-I2V 基础模型构建了两阶段训练流水线:

  1. 潜在空间适配(阶段 1): 模型学习将低分辨率(LR)视频潜在表示与稀疏编码的高分辨率(HR)关键帧潜在表示融合,以实现视频中细节的稳健传播。
  2. 像素空间精炼(阶段 2): 模型在像素空间中精炼感知细节,平衡对所提供关键帧的遵循与在关键帧缺失或不完美时执行「盲恢复」的能力。

在推理阶段,用户可以通过商业 API、开源模型(如 PiSA-SR)或使用无参考模式提供关键帧。系统在保持原始 LR 视频运动约束的前提下,将这些高质量先验信息传播到整个视频中。

适用人群

本工具专为从事视频恢复的研究人员和开发者,以及需要可控、高质量放大功能的创作者(如老电影修复、视频风格迁移)设计。

主要亮点

  • 交互式控制: 支持手动指定关键帧以引导超分辨率过程。
  • 灵活的参考模式: 支持 API 驱动、模型驱动(PiSA-SR)或无参考(盲超分辨率)恢复。
  • 时间一致性: 相较于现有基线,显著提升时间稳定性与恢复质量。
  • 通用框架: 可应用于简单放大之外的任务,如风格迁移和老电影修复。
  • ComfyUI 集成: 提供 ComfyUI 实现,支持更灵活的节点化推理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目