NVlabs/rcm
rCM & Causal-rCM: Leading and Unified Algorithms/Infrastructures for Bidirectional/Autoregressive Video Diffusion Distillation at Scale
解决的问题
rCM 解决了少步数视频生成中的质量和多样性瓶颈。具体而言,它通过结合离线前向发散(forward-divergence)和在线策略反KL(reverse-KL)蒸馏框架,克服了现有连续时间一致性蒸馏方法(如 sCM)的局限性,从而在保持高视觉质量的同时,保留原始教师模型的多样性。
工作原理
该项目实现了一种得分正则化的连续时间一致性模型。它采用联合蒸馏框架,补充一致性模型(CM)和扩散模型蒸馏(DMD),仅需 2 到 4 次采样步骤即可实现高质量视频生成。
针对流式视频和交互式世界模型,引入了 Causal-rCM,该模型整合了教师强制(前向发散)和自强制(反向发散)训练堆栈,以支持自回归视频扩散蒸馏。
适用人群
从事视频扩散模型研究与开发的 AI 研究人员和工程师,特别是那些希望将蒸馏扩展到大模型(10B+ 参数)或开发流式视频生成与交互式世界模型的人。
主要亮点
- 少步生成:在 1–4 步内生成高质量、多样化的视频。
- 可扩展基础设施:利用 FSDP2、Ulysses Context Parallel (CP) 和 Selective Activation Checkpointing (SAC) 支持扩展至 10B+ 参数模型。
- 自定义内核:包含开源的 FlashAttention-2 雅可比向量积(JVP)内核。
- 因果扩展:提供统一的自回归训练方案,包括优化的因果推理(量化 KV 缓存和长度外推)。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目