MeiGen-AI/OPSD-V
On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
解决的问题
OPSD-V 解决了少数步骤自回归(AR)视频生成器中的误差累积和运动动态减弱问题。在这些模型中,一个生成块中的微小伪影或语义漂移会被写回 KV 缓存,进而降低所有后续块的质量,导致长期视觉质量下降。
工作原理
采用后训练阶段的在策略自蒸馏范式。"学生"模型在训练期间遵循与实际部署推理完全相同的流程——生成块并更新自身的 KV 缓存;而"教师"模型则在相同的去噪状态下进行评估。然而,教师模型会获得一个由真实长视频上下文构建的更干净、符合 AR 一致性的时序缓存。通过将学生模型的速度预测与教师模型对齐,模型在不改变原始少数步骤采样器或推理时缓存机制的前提下,获得了密集的校正目标,从而提升了稳定性。
适用人群
从事自回归视频生成的研究人员和开发者,特别是希望提升少数步骤扩散模型长期稳定性和运动质量的用户。
亮点
- 在策略学生推理路径:学生模型在训练期间维护自身生成的 KV 缓存,以模拟真实推理场景。
- 更干净的教师上下文:利用真实视频历史构建高质量参考,供教师模型使用。
- 保留原始推理路径:维持原始的 4 步 AR 采样器,确保部署时无延迟增加。
- 内存高效的训练:采用分块反向传播、FSDP 以及 LoRA/EMA 支持,使长视频训练成为可能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目