Kevin-thu/StoryMem

Official code for StoryMem: Multi-shot Long Video Storytelling with Memory

何を解決するか

StoryMemは、ストーリーのスクリプトに基づいて複数ショットのナラティブ動画を生成する際、キャラクターの一貫性や映画的な品質を維持するという課題に取り組んでいます。従来の動画生成手法では、複数のショットを連続して生成する際に「キャラクターのずれ」や視覚的な不一致が生じやすいです。

仕組み

このシステムは、メモリ条件付きの単一ショット動画拡散モデルを使用して、ショットごとに動画を生成します。最初のショットはテキストから動画を生成するモデルで作成し、ベースラインのメモリを確立します。その後のショットでは、Wan2.2ベースモデルで微調整された専用のMemory-to-Video (M2V) LoRAを使用します。プロセスは以下の通りです:

  • メモリ管理:生成されたショットからキーフレームを自動抽出し、メモリバッファを更新することで視覚的一貫性を維持します。
  • 条件付きモード:M2V(メモリのみ)、MI2V(次のショットの最初のフレーム画像+メモリ)、MM2V(最初の5フレームの動き+メモリ)の複数の条件付きモードをサポートします。
  • スクリプト駆動生成:各ショットのシーンカットと特定のプロンプトを定義する構造化されたJSON形式のストーリースクリプトに従います。

対象ユーザー

AI研究者、デジタルストーリーテラー、クリエイター向けに設計されており、キャラクターと環境の安定したアイデンティティを備えた、1分程度の一貫性のあるナラティブ動画を生成したい人向けです。

特徴

  • 複数ショットの一貫性:メモリ機構を用いて、複数ショットにわたってキャラクターと視覚的一貫性を維持します。
  • 柔軟な条件付き処理:M2V、MI2V、MM2Vの複数モードを提供し、シーンカットや隣接ショット間のスムーズなトランジションに対応します。
  • ST-Bench:30の長編ストーリースクリプトと300の詳細な動画プロンプトから構成される新しい評価ベンチマークを含みます。
  • Wan2.2統合:Wan2.2 MoE動画拡散アーキテクチャに基づいて構築されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト