Kevin-thu/StoryMem

Official code for StoryMem: Multi-shot Long Video Storytelling with Memory

解决的问题

StoryMem 解决了在基于故事脚本生成长篇多镜头叙事视频时,保持角色一致性和场景视觉质量的挑战。传统视频生成方法在生成一系列镜头时,常常会出现“角色漂移”或视觉不一致的问题。

工作原理

该系统使用一种记忆条件化的单镜头视频扩散模型,逐镜头生成视频。首先通过文本到视频模型生成初始镜头,建立基准记忆。对于后续镜头,则使用在 Wan2.2 基础模型上微调的专用 Memory-to-Video (M2V) LoRA。该过程包括:

  • 记忆管理:模型自动从生成的镜头中提取关键帧,并更新记忆缓冲区,以维持视觉连贯性。
  • 条件模式:支持多种条件模式,包括 M2V(仅记忆)、MI2V(记忆 + 下一镜头的第一帧图像)、MM2V(记忆 + 前五帧运动帧)。
  • 脚本驱动生成:遵循结构化的 JSON 故事脚本,定义每个镜头的场景切换和特定提示。

适用人群

本工具专为 AI 研究人员、数字叙事创作者以及需要生成具有稳定角色身份和环境的一致性、时长约一分钟的叙事视频的创作者设计。

核心亮点

  • 多镜头一致性:通过记忆机制,在多个镜头间保持角色和视觉连贯性。
  • 灵活的条件控制:提供多种模式(M2V、MI2V、MM2V),可处理场景切换和相邻镜头间的平滑过渡。
  • ST-Bench:包含一个全新的评估基准,包含 30 个长篇故事脚本和 300 个详细视频提示。
  • Wan2.2 集成:基于 Wan2.2 MoE 视频扩散架构构建。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目