OpenImagingLab/FlashVSR
[CVPR 2026] Towards Real-Time Diffusion-Based Streaming Video Super-Resolution — An efficient one-step diffusion framework for streaming VSR with locality-constrained sparse attention and a tiny conditional decoder.
⚡ FlashVSR – 實時擴散基流媒體影片超解析度
是什麼
- 一個研究級的程式庫,使用經過大幅蒸餾以提升速度的擴散模型,將低解析度影片(通常為4倍)上採樣至高解析度影片。
- 作者聲稱在單張NVIDIA A100上處理768 × 1408影片時可實現約17 FPS,使其成為首個可實時(近實時)運行的擴散基VSR系統。
為何重要
- 擴散模型提供卓越的視覺品質,但通常對影片處理而言過於緩慢。FlashVSR透過三項工程技巧解決此問題:
- 三階段蒸餾流程 – 訓練一個大型教師模型,然後將其壓縮為可逐幀處理的串流友好型學生模型。
- 局部限制稀疏注意力(LCSA) – 僅關注小範圍的空間-時間鄰域,大幅減少冗餘計算,並縮小訓練時與推論時解析度之間的差距。
- 超小型條件解碼器 – 一個輕量級重建頭,可在不承擔完整擴散解碼器高昂成本的前提下恢復細節。
- 提供了一個新的VSR-120K資料集(12萬影片,18萬張影像),用於大規模訓練。
核心元件
| 元件 | 作用 |
|---|---|
| 三階段蒸餾 | 將重型擴散教師模型轉化為可逐幀運行的串流學生模型。 |
| LCSA | 稀疏注意力遮罩,限制每個token僅關注鄰近像素/幀,顯著降低FLOPs。 |
| 超小型條件解碼器 | 快速上採樣頭,接收蒸餾後的潛在表示並生成最終高解析度幀。 |
| 塊稀疏注意力後端 | 外部程式庫(MIT-HAN-Lab)實現LCSA所需的自訂稀疏內核。 |
| VSR-120K資料集 | 用於訓練模型的大規模、多樣化影片-影像集合;於Hugging Face上發布。 |
典型工作流程
- 安裝 Python套件(
pip install -e .)和所需的Block-Sparse-Attention套件。 - 下載 使用Git LFS從Hugging Face下載預訓練權重(v1.1為推薦版本,更穩定)。
- 執行 在低解析度影片幀資料夾上執行提供的推論腳本之一(
infer_flashvsr_v1.1_full.py、*_tiny.py或長影片變體)。 - 腳本將幀流經蒸餾後的擴散模型,即時應用LCSA,並輸出上採樣後的影片。
應用場景
- 需要快速、高品質地將4K/8K素材上採樣用於串流平台的內容創作者。
- 實時預覽上採樣影片對後製流程具有價值的場景。
- 高效擴散模型、串流影片處理或稀疏注意力機制的研究。
安裝重點
# 克隆倉儲
git clone https://github.com/OpenImagingLab/FlashVSR && cd FlashVSR
# 建立conda環境(Python 3.11)
conda create -n flashvsr python=3.11 && conda activate flashvsr
# 安裝套件及相依性
pip install -e .
pip install -r requirements.txt
# 安裝Block-Sparse-Attention(倉儲外)
git clone https://github.com/mit-han-lab/Block-Sparse-Attention && cd Block-Sparse-Attention
pip install packaging ninja
python setup.py install
GPU注意:已在NVIDIA A100/A800(Ampere)和H200(Hopper)上測試。消費級RTX 40/50系列卡上的效能未記錄。
執行推論(範例)
cd examples/WanVSR
# 首先使用Git LFS下載v1.1權重(參見README)
python infer_flashvsr_v1.1_full.py # 完整解碼器,最佳品質
# 或
python infer_flashvsr_v1.1_tiny.py # 超小型解碼器,更快,略低品質
腳本會自動定位權重資料夾(FlashVSR-v1.1/)並輸出上採樣影片。
社群與生態
- 存在多個ComfyUI封裝,但早期版本遺漏了LCSA模組,導致品質下降。
- 第三方雲端服務(fal.ai、WaveSpeed AI、Segmind等)提供模型託管,便於基於Web的推論。
- 作者提供專案頁面、Hugging Face模型倉儲和可下載資料集。
引用
@article{zhuang2025flashvsr,
title={FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution},
author={Zhuang, Junhao and Guo, Shi and Cai, Xin and Li, Xiaohui and Liu, Yihao and Yuan, Chun and Xue, Tianfan},
journal={arXiv preprint arXiv:2510.12747},
year={2025}
}
總結:FlashVSR是一個真正的前沿AI專案,透過蒸餾、稀疏注意力和超小型解碼器的結合,使基於擴散的影片上採樣快到足以用於互動式應用。它適合任何需要高品質、即時影片超解析度的使用者,也適合探索高效擴散架構的研究人員。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch