Kevin-thu/StoryMem

Official code for StoryMem: Multi-shot Long Video Storytelling with Memory

解決的問題

StoryMem 解決了在根據故事腳本生成長篇多鏡頭敘事影片時,維持角色一致性與場景視覺品質的挑戰。傳統影片生成方法在生成一系列鏡頭時,經常會出現「角色漂移」或視覺不一致的問題。

工作原理

該系統使用記憶條件化的單鏡頭影片擴散模型,逐鏡頭生成影片。首先透過文字轉影片模型生成初始鏡頭,建立基準記憶。對於後續鏡頭,則使用在 Wan2.2 基礎模型上微調的專用 Memory-to-Video (M2V) LoRA。該過程包括:

  • 記憶管理:模型自動從生成的鏡頭中提取關鍵幀,並更新記憶緩衝區,以維持視覺連貫性。
  • 條件模式:支援多種條件模式,包括 M2V(僅記憶)、MI2V(記憶 + 下一鏡頭的第一幀影像)、MM2V(記憶 + 前五幀運動幀)。
  • 腳本驅動生成:遵循結構化的 JSON 故事腳本,定義每個鏡頭的場景切換與特定提示。

適用對象

本工具專為 AI 研究人員、數位敘事創作者以及需要生成具有穩定角色身分與環境的一致性、時長約一分鐘的敘事影片的創作者設計。

核心亮點

  • 多鏡頭一致性:透過記憶機制,在多個鏡頭間保持角色與視覺連貫性。
  • 靈活的條件控制:提供多種模式(M2V、MI2V、MM2V),可處理場景切換與相鄰鏡頭間的平滑過渡。
  • ST-Bench:包含一個全新的評估基準,包含 30 個長篇故事腳本與 300 個詳細影片提示。
  • Wan2.2 集成:基於 Wan2.2 MoE 影片擴散架構建構。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案