taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
解決的問題
SparkVSR 解決了傳統影片超解析度(VSR)的「黑箱」特性,即使用者無法修正偽影或引導還原過程的問題。它透過允許使用者提供少量高品質的關鍵幀作為控制訊號,將 VSR 轉變為一個互動式過程,從而引導整個影片序列的還原。
工作原理
SparkVSR 基於 CogVideoX1.5-5B-I2V 基礎模型,建構了兩階段訓練流程:
- 潛在空間適應(階段 1): 模型學習將低解析度(LR)影片潛在表示與稀疏編碼的高解析度(HR)關鍵幀潛在表示融合,以實現影片中細節的穩健傳播。
- 像素空間精煉(階段 2): 模型在像素空間中精煉感知細節,平衡對所提供關鍵幀的遵循與在關鍵幀遺失或不完美時執行「盲還原」的能力。
在推論階段,使用者可透過商業 API、開源模型(如 PiSA-SR)或使用無參考模式提供關鍵幀。系統在保持原始 LR 影片運動約束的前提下,將這些高品質先驗資訊傳播至整個影片中。
適用對象
本工具專為從事影片還原的研究人員與開發者,以及需要可控、高品質放大功能的創作者(如老電影修復、影片風格轉移)設計。
主要亮點
- 互動式控制: 支援手動指定關鍵幀以引導超解析度過程。
- 靈活的參考模式: 支援 API 驅動、模型驅動(PiSA-SR)或無參考(盲超解析度)還原。
- 時間一致性: 相較於現有基線,顯著提升時間穩定性與還原品質。
- 通用框架: 可應用於簡單放大之外的任務,如風格轉移和老電影修復。
- ComfyUI 集成: 提供 ComfyUI 實作,支援更靈活的節點化推論。
相關
- 專案
- 專案
- 專案
- 專案
- 專案