taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
What it solves
SparkVSRは、ユーザーがアーティファクトを修正したり出力を制御したりできない、従来のビデオ超解像 (VSR) モデルの「ブラックボックス」的な性質に対処処します。少数の高品質なキーフレームを使用して復元プロセスをガイドするためのインタラクティブなフレームワークを提供し、最終的なビデオが元の動きを維持しながら、高い視覚的品質を確保することを可能にします。
How it works
SparkVSRは、CogVideoX1.5-5B-I2V ベースモデルに基づいた2段階のトレーニングパイプラインを使用します:
- Stage-1 (Latent-Space): モデルは、低解像度 (LR) ビデオの潜在空間 (latents) と疎な高解像度 (HR) キーフレームの潜在空間 (latents) を融合させることを学習し、堅牢なクロススペース伝播を可能にします。
- Stage-2 (Pixel-Space): モデルは、ピクセル空間で知覚的詳細を洗練させ、出力が提供されたキーフレームに準拠しつつ、参照が欠如している場合には「ブラインド」復元を実行する能力を維持します。
推論時、システムは3つのモードをサポートしています:商用API (例:nano-banana-pro) を使用してキーフレームを生成する、オープンソースの PiSA-SR モデルを使用する、またはリファレンスフリーモード。
Who it’s for
ビデオ復元、古いフィルムの復元、ビデオスタイル転送に取り組む研究者や開発者で、制御可能な高品質なアップスケーリングが必要な方々。
Highlights
- Interactive Control: 疎なキーフレームを表現力豊かな制御信号として使用し、超解像プロセスをガイドします。
- Flexible Reference Modes: 商用API、オープンソースモデル、およびリファレンスフリーのフォールバックとして、複数のキーフレームソースをサポートします。
- Coutrollable Adherence: モデルが提供されたキーフレームにどの程度厳密に追従するかを調整するためのガイダンススケールが含まれています。
- Broad Applicability: VSR以外のタスク、例えばスタイル転送や古いフィルムの復元にも適用可能です。
- ComfyUI Integration: より柔軟でノードベースの推論を行うための ComfyUI 実装を提供します。