vita-epfl/Stable-Video-Infinity

[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

解决的问题

Stable Video Infinity (SVI) 解决了 AI 模型在生成短视频时的限制,能够创建任意长度(潜在无限)的视频,同时保持高时间一致性、合理的场景转换以及可控的故事情节,且不会随时间推移而出现质量下降或“遗忘”现象。

运作原理

SVI 采用混合因果关系方法:它在单个视频片段内使用双向注意力机制以确保高视觉质量,然后使用片段间的因果关系将这些片段顺序连接起来。该系统实现为基于 Wan 2.1 和 Wan 2.2 等基础模型微调的 LoRA 适配器,仅需极少的训练数据即可实现长距离生成能力。

适用对象

它专为需要制作长篇 AI 视频内容的创作者、电影制作人和动画师而设计,例如短片、单场景动画或叙事视频,在这些场景中,跨越数分钟的连续性至关重要。

特色亮点

  • 无限长度:对持续时间没有内在限制,能够制作长达 10 分钟或更长时间的视频。
  • 高一致性:保持视觉稳定性,防止长序列中的色彩漂移或内容退化。
  • 多功能生成:支持多场景电影、单场景动画和条件生成(骨架或音频)。
  • 高效训练:使用 LoRA 适配器,让用户能以极少的数据轻松建立自己的 SVI 变体。
  • 开源:提供开放的训练脚本、评估工具和数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目