taco-group/SparkVSR
[ECCV 2026] SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
何を解決するか
SparkVSRは従来の動画スーパーレゾリューション(VSR)の「ブラックボックス」性に対処し、ユーザーがアーティファクトを修正したり、復元プロセスをガイドしたりする手段がなかった問題を解決します。ユーザーが少量の高品質なキーフレームを提供することで、VSRをインタラクティブなプロセスに変革し、動画全体の復元を制御可能にします。
動作方法
SparkVSRはCogVideoX1.5-5B-I2Vベースモデルに基づく2段階のトレーニングパイプラインを使用しています:
- 潜在空間の適応(ステージ1): モデルは低解像度(LR)動画の潜在表現と、疎に符号化された高解像度(HR)キーフレームの潜在表現を融合することで、動画全体にわたる詳細の堅牢な伝搬を可能にします。
- ピクセル空間の精緻化(ステージ2): モデルはピクセル空間で知覚的な詳細を精緻化し、提供されたキーフレームに従う一方で、キーフレームが欠落または不完全な場合でも「盲目的」な復元を実行する能力を維持します。
推論時、ユーザーは商用API、オープンソースモデル(例:PiSA-SR)、またはリファレンスフリーモードを用いてキーフレームを提供できます。システムはこれらの高品質な事前知識を動画全体に伝搬しつつ、元のLR動画の動きに基づいて制約を保ちます。
対象ユーザー
本ツールは、動画復元に取り組む研究者や開発者、また古映画の復元や動画スタイル転送など、制御可能で高品質な拡大が必要なクリエイター向けに設計されています。
特徴
- インタラクティブな制御: キーフレームの手動指定により、スーパーレゾリューションプロセスをガイド可能。
- 柔軟なリファレンスモード: API駆動、モデル駆動(PiSA-SR)、またはリファレンスフリー(盲目的SR)の復元をサポート。
- 時間的一貫性: 既存のベースラインと比較して、時間的安定性と復元品質を向上。
- 汎用フレームワーク: 単なる拡大にとどまらず、スタイル転送や古映画復元などのタスクにも適用可能。
- ComfyUI統合: より柔軟なノードベース推論を可能にするComfyUI実装を含む。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト