OpenImagingLab/FlashVSR

[CVPR 2026] Towards Real-Time Diffusion-Based Streaming Video Super-Resolution — An efficient one-step diffusion framework for streaming VSR with locality-constrained sparse attention and a tiny conditional decoder.

⚡ FlashVSR – 实时扩散基流媒体视频超分辨率

是什么

  • 一个研究级库,使用经过大幅蒸馏以提升速度的扩散模型,将低分辨率视频(通常为4倍)上采样至高分辨率视频。
  • 作者声称在单张NVIDIA A100上处理768 × 1408视频时可实现约17 FPS,使其成为首个可实现实时(近实时)运行的扩散基VSR系统。

为何重要

  • 扩散模型提供卓越的视觉质量,但通常对视频处理而言过于缓慢。FlashVSR通过三项工程技巧解决了这一问题:
    1. 三阶段蒸馏流水线 – 训练一个大型教师模型,然后将其压缩为可逐帧处理的流媒体友好型学生模型。
    2. 局部约束稀疏注意力(LCSA) – 仅关注小范围的空间-时间邻域,大幅减少冗余计算,并缩小训练时与推理时分辨率之间的差距。
    3. 超小条件解码器 – 一个轻量级重建头,可在不承担完整扩散解码器高昂成本的前提下恢复细节。
  • 提供了一个新的VSR-120K数据集(12万视频,18万图像),用于大规模训练。

核心组件

组件 作用
三阶段蒸馏 将重型扩散教师模型转化为可逐帧运行的流媒体学生模型。
LCSA 稀疏注意力掩码,限制每个token仅关注邻近像素/帧,显著降低FLOPs。
超小条件解码器 快速上采样头,接收蒸馏后的潜在表示并生成最终高分辨率帧。
块稀疏注意力后端 外部库(MIT-HAN-Lab)实现LCSA所需的自定义稀疏内核。
VSR-120K数据集 用于训练模型的大规模、多样化视频-图像集合;在Hugging Face上发布。

典型工作流

  1. 安装 Python包(pip install -e .)和所需的Block-Sparse-Attention库。
  2. 下载 使用Git LFS从Hugging Face下载预训练权重(v1.1为推荐版本,更稳定)。
  3. 运行 在低分辨率视频帧文件夹上运行提供的推理脚本之一(infer_flashvsr_v1.1_full.py*_tiny.py 或长视频变体)。
  4. 脚本将帧流经蒸馏后的扩散模型,实时应用LCSA,并输出上采样后的视频。

应用场景

  • 需要快速、高质量地将4K/8K素材上采样用于流媒体平台的内容创作者。
  • 实时预览上采样视频对后期制作流程具有价值的场景。
  • 高效扩散模型、流媒体视频处理或稀疏注意力机制的研究。

安装要点

# 克隆仓库
git clone https://github.com/OpenImagingLab/FlashVSR && cd FlashVSR

# 创建conda环境(Python 3.11)
conda create -n flashvsr python=3.11 && conda activate flashvsr

# 安装包及依赖
pip install -e .
pip install -r requirements.txt

# 安装Block-Sparse-Attention(仓库外)
git clone https://github.com/mit-han-lab/Block-Sparse-Attention && cd Block-Sparse-Attention
pip install packaging ninja
python setup.py install

GPU注意:已在NVIDIA A100/A800(Ampere)和H200(Hopper)上测试。消费级RTX 40/50系列卡上的性能未记录。

运行推理(示例)

cd examples/WanVSR
# 首先使用Git LFS下载v1.1权重(参见README)
python infer_flashvsr_v1.1_full.py   # 完整解码器,最佳质量
# 或
python infer_flashvsr_v1.1_tiny.py    # 超小解码器,更快,略低质量

脚本会自动定位权重文件夹(FlashVSR-v1.1/)并输出上采样视频。

社区与生态

  • 存在多个ComfyUI封装,但早期版本遗漏了LCSA模块,导致质量下降。
  • 第三方云服务(fal.ai、WaveSpeed AI、Segmind等)提供模型托管,便于基于Web的推理。
  • 作者提供项目页面、Hugging Face模型仓库和可下载数据集。

引用

@article{zhuang2025flashvsr,
  title={FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution},
  author={Zhuang, Junhao and Guo, Shi and Cai, Xin and Li, Xiaohui and Liu, Yihao and Yuan, Chun and Xue, Tianfan},
  journal={arXiv preprint arXiv:2510.12747},
  year={2025}
}

总结:FlashVSR是一个真正的前沿AI项目,通过蒸馏、稀疏注意力和超小解码器的结合,使基于扩散的视频上采样快到足以用于交互式应用。它适合任何需要高质量、实时视频超分辨率的用户,也适合探索高效扩散架构的研究人员。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch