Kevin-thu/StoryMem
Official code for StoryMem: Multi-shot Long Video Storytelling with Memory
해결하는 문제
StoryMem은 스토리 스크립트를 기반으로 긴 다중 샷 내러티브 영상을 생성할 때 캐릭터와 시각적 일관성, 영화적 품질을 유지하는 문제를 해결합니다. 기존의 영상 생성 기술은 여러 장면을 연속적으로 생성할 때 '캐릭터 드리프트' 또는 시각적 불일치가 발생하는 경향이 있습니다.
작동 방식
이 시스템은 메모리 조건부 단일 샷 영상 확산 모델을 사용하여 샷별로 영상을 생성합니다. 처음에는 텍스트에서 영상으로 변환하는 모델을 사용해 초기 샷을 생성하여 기준 메모리를 설정합니다. 이후 샷에서는 Wan2.2 기반 모델에 미세 조정된 특화된 Memory-to-Video (M2V) LoRA를 사용합니다. 프로세스는 다음과 같습니다:
- 메모리 관리: 생성된 샷에서 키프레임을 자동으로 추출하고 메모리 버퍼를 업데이트하여 시각적 일관성을 유지합니다.
- 조건부 옵션: M2V(메모리만), MI2V(다음 샷의 첫 프레임 이미지 + 메모리), MM2V(첫 5개의 움직임 프레임 + 메모리) 등 다양한 조건부 모드를 지원합니다.
- 스크립트 기반 생성: 각 샷의 장면 전환과 특정 프롬프트를 정의하는 구조화된 JSON 스토리 스크립트를 따릅니다.
대상 사용자
이 도구는 AI 연구자, 디지털 스토리텔러, 콘텐츠 제작자 등 캐릭터와 환경의 일관성을 유지하면서 1분 정도의 연속적인 내러티브 영상을 생성해야 하는 사용자를 위한 것입니다.
주요 특징
- 다중 샷 일관성: 메모리 메커니즘을 통해 여러 샷에 걸쳐 캐릭터와 시각적 일관성을 유지합니다.
- 유연한 조건부 처리: M2V, MI2V, MM2V 등 다양한 모드를 제공하여 장면 전환과 인접 샷 간의 부드러운 전환을 처리할 수 있습니다.
- ST-Bench: 30개의 긴 스토리 스크립트와 300개의 상세한 영상 프롬프트로 구성된 새로운 평가 벤치마크를 포함합니다.
- Wan2.2 통합: Wan2.2 MoE 영상 확산 아키텍처를 기반으로 구축되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트