UCSC-VLAA/story-iter
[ICLR 2026] A Training-free Iterative Framework for Long Story Visualization
What it solves
Story-Iter는 스토리(최대 100 프레임)를 위한 긴 이미지 시퀀스를 생성할 때 의미 일관성과 고품질 상호작용을 유지하는 어려움을 해결합니다. 기존 텍스트‑투‑이미지 모델은 비용이 많이 드는 학습이나 소수의 고정 레퍼런스 이미지에 의존하지 않고 다수의 프레임에서 캐릭터와 설정을 일관되게 유지하기 어렵습니다.
How it works
학습이 필요 없는 반복 패러다임을 사용하여 확산 모델의 표준 디노이징 단계를 넘어섭니다. 프로세스는 라운드별로 진행됩니다:
- Initialization: 먼저 스토리 텍스트 프롬프트만을 기반으로 초기 이미지 세트를 생성합니다.
- Iteration: 이후 각 라운드에서는 이전 라운드의 모든 이미지를 레퍼런스로 사용합니다.
- Global Reference Cross-Attention (GRCA): Stable Diffusion에 플러그‑앤‑플레이 모듈을 삽입해 전역 임베딩을 활용해 모든 레퍼런스 프레임의 정보를 집계하고, 전체 시퀀스에 걸쳐 시각적 컨텍스트가 유지되도록 합니다.
Who it’s for
이 도구는 자동 스토리 시각화, 만화 생성, 또는 캐릭터와 장면의 일관성이 중요한 장편 시각 내러티브에 관심이 있는 창작자와 연구자를 위해 설계되었습니다.
Highlights
- Training-free: 일관성을 달성하기 위해 추가 모델 학습이 필요하지 않습니다.
- Long-sequence support: 최대 100 프레임까지 스토리를 시각화할 수 있습니다.
- Flexible styles: 만화, 영화, 리얼리즘 등 다양한 출력 스타일을 지원합니다.
- ControlNet integration: 정확한 캐릭터 포징을 위해 openPose 스켈레톤을 제어 신호로 지원합니다.
- Fast execution: 빠른 버전(LCM 사용)을 포함해 100프레임 스토리를 약 20분 안에 10번의 반복으로 처리할 수 있습니다.