MeiGen-AI/OPSD-V

On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

解決的問題

OPSD-V 解決了少步數自回歸(AR)影片生成器中的誤差累積與運動動態弱化問題。在這些模型中,單一生成區塊中的微小偽影或語意漂移會被寫回 KV 快取,進而降低所有後續區塊的品質,導致長期視覺品質下降。

工作原理

採用後訓練階段的在策略自蒸餾範式。"學生"模型在訓練期間遵循與實際部署推理完全相同的流程——生成區塊並更新自身的 KV 快取;而"教師"模型則在相同的去噪狀態下進行評估。然而,教師模型會獲得一個由真實長影片上下文構建的更乾淨、符合 AR 一致性的時序快取。透過將學生模型的速度預測與教師模型對齊,模型在不改變原始少步數採樣器或推理時快取機制的前提下,獲得密集的校正目標,從而提升穩定性。

適用對象

從事自回歸影片生成的研究人員與開發者,特別是希望提升少步數擴散模型長期穩定性與運動品質的使用者。

亮點

  • 在策略學生推理路徑:學生模型在訓練期間維護自身生成的 KV 快取,以模擬真實推理場景。
  • 更乾淨的教師上下文:利用真實影片歷史構建高品質參考,供教師模型使用。
  • 保留原始推理路徑:維持原始的 4 步 AR 採樣器,確保部署時無延遲增加。
  • 記憶體高效的訓練:採用分塊反向傳播、FSDP 以及 LoRA/EMA 支援,使長影片訓練成為可能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案