MeiGen-AI/OPSD-V

On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

解决的问题

OPSD-V 解决了少数步骤自回归(AR)视频生成器中的误差累积和运动动态减弱问题。在这些模型中,一个生成块中的微小伪影或语义漂移会被写回 KV 缓存,进而降低所有后续块的质量,导致长期视觉质量下降。

工作原理

采用后训练阶段的在策略自蒸馏范式。"学生"模型在训练期间遵循与实际部署推理完全相同的流程——生成块并更新自身的 KV 缓存;而"教师"模型则在相同的去噪状态下进行评估。然而,教师模型会获得一个由真实长视频上下文构建的更干净、符合 AR 一致性的时序缓存。通过将学生模型的速度预测与教师模型对齐,模型在不改变原始少数步骤采样器或推理时缓存机制的前提下,获得了密集的校正目标,从而提升了稳定性。

适用人群

从事自回归视频生成的研究人员和开发者,特别是希望提升少数步骤扩散模型长期稳定性和运动质量的用户。

亮点

  • 在策略学生推理路径:学生模型在训练期间维护自身生成的 KV 缓存,以模拟真实推理场景。
  • 更干净的教师上下文:利用真实视频历史构建高质量参考,供教师模型使用。
  • 保留原始推理路径:维持原始的 4 步 AR 采样器,确保部署时无延迟增加。
  • 内存高效的训练:采用分块反向传播、FSDP 以及 LoRA/EMA 支持,使长视频训练成为可能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目