OpenImagingLab/FlashVSR
[CVPR 2026] Towards Real-Time Diffusion-Based Streaming Video Super-Resolution — An efficient one-step diffusion framework for streaming VSR with locality-constrained sparse attention and a tiny conditional decoder.
⚡ FlashVSR – 实时扩散基流媒体视频超分辨率
是什么
- 一个研究级库,使用经过大幅蒸馏以提升速度的扩散模型,将低分辨率视频(通常为4倍)上采样至高分辨率视频。
- 作者声称在单张NVIDIA A100上处理768 × 1408视频时可实现约17 FPS,使其成为首个可实现实时(近实时)运行的扩散基VSR系统。
为何重要
- 扩散模型提供卓越的视觉质量,但通常对视频处理而言过于缓慢。FlashVSR通过三项工程技巧解决了这一问题:
- 三阶段蒸馏流水线 – 训练一个大型教师模型,然后将其压缩为可逐帧处理的流媒体友好型学生模型。
- 局部约束稀疏注意力(LCSA) – 仅关注小范围的空间-时间邻域,大幅减少冗余计算,并缩小训练时与推理时分辨率之间的差距。
- 超小条件解码器 – 一个轻量级重建头,可在不承担完整扩散解码器高昂成本的前提下恢复细节。
- 提供了一个新的VSR-120K数据集(12万视频,18万图像),用于大规模训练。
核心组件
| 组件 | 作用 |
|---|---|
| 三阶段蒸馏 | 将重型扩散教师模型转化为可逐帧运行的流媒体学生模型。 |
| LCSA | 稀疏注意力掩码,限制每个token仅关注邻近像素/帧,显著降低FLOPs。 |
| 超小条件解码器 | 快速上采样头,接收蒸馏后的潜在表示并生成最终高分辨率帧。 |
| 块稀疏注意力后端 | 外部库(MIT-HAN-Lab)实现LCSA所需的自定义稀疏内核。 |
| VSR-120K数据集 | 用于训练模型的大规模、多样化视频-图像集合;在Hugging Face上发布。 |
典型工作流
- 安装 Python包(
pip install -e .)和所需的Block-Sparse-Attention库。 - 下载 使用Git LFS从Hugging Face下载预训练权重(v1.1为推荐版本,更稳定)。
- 运行 在低分辨率视频帧文件夹上运行提供的推理脚本之一(
infer_flashvsr_v1.1_full.py、*_tiny.py或长视频变体)。 - 脚本将帧流经蒸馏后的扩散模型,实时应用LCSA,并输出上采样后的视频。
应用场景
- 需要快速、高质量地将4K/8K素材上采样用于流媒体平台的内容创作者。
- 实时预览上采样视频对后期制作流程具有价值的场景。
- 高效扩散模型、流媒体视频处理或稀疏注意力机制的研究。
安装要点
# 克隆仓库
git clone https://github.com/OpenImagingLab/FlashVSR && cd FlashVSR
# 创建conda环境(Python 3.11)
conda create -n flashvsr python=3.11 && conda activate flashvsr
# 安装包及依赖
pip install -e .
pip install -r requirements.txt
# 安装Block-Sparse-Attention(仓库外)
git clone https://github.com/mit-han-lab/Block-Sparse-Attention && cd Block-Sparse-Attention
pip install packaging ninja
python setup.py install
GPU注意:已在NVIDIA A100/A800(Ampere)和H200(Hopper)上测试。消费级RTX 40/50系列卡上的性能未记录。
运行推理(示例)
cd examples/WanVSR
# 首先使用Git LFS下载v1.1权重(参见README)
python infer_flashvsr_v1.1_full.py # 完整解码器,最佳质量
# 或
python infer_flashvsr_v1.1_tiny.py # 超小解码器,更快,略低质量
脚本会自动定位权重文件夹(FlashVSR-v1.1/)并输出上采样视频。
社区与生态
- 存在多个ComfyUI封装,但早期版本遗漏了LCSA模块,导致质量下降。
- 第三方云服务(fal.ai、WaveSpeed AI、Segmind等)提供模型托管,便于基于Web的推理。
- 作者提供项目页面、Hugging Face模型仓库和可下载数据集。
引用
@article{zhuang2025flashvsr,
title={FlashVSR: Towards Real-Time Diffusion-Based Streaming Video Super-Resolution},
author={Zhuang, Junhao and Guo, Shi and Cai, Xin and Li, Xiaohui and Liu, Yihao and Yuan, Chun and Xue, Tianfan},
journal={arXiv preprint arXiv:2510.12747},
year={2025}
}
总结:FlashVSR是一个真正的前沿AI项目,通过蒸馏、稀疏注意力和超小解码器的结合,使基于扩散的视频上采样快到足以用于交互式应用。它适合任何需要高质量、实时视频超分辨率的用户,也适合探索高效扩散架构的研究人员。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch