UCSC-VLAA/story-iter
[ICLR 2026] A Training-free Iterative Framework for Long Story Visualization
What it solves
Story-Iter 解决了在为故事(最多 100 帧)生成长序列图像时,保持语义一致性和高质量交互的难题。传统的文本到图像模型往往难以在多帧中保持角色和场景的一致性,除非进行昂贵的训练或依赖少量固定参考图像。
How it works
它使用一种无需训练的迭代范式,超越了扩散模型的标准去噪步骤。过程分为多轮进行:
- Initialization:首先仅根据故事的文本提示生成一组初始图像。
- Iteration:在每个后续轮次中,使用前一轮的所有图像作为参考。
- Global Reference Cross-Attention (GRCA):在 Stable Diffusion 中插入即插即用的模块,利用全局嵌入聚合所有参考帧的信息,确保整个序列的视觉上下文得以保持。
Who it’s for
此工具面向创作者和研究者,适用于自动化故事可视化、漫画生成,或需要角色与场景一致性的长篇视觉叙事。
Highlights
- Training-free:不需要额外的模型训练即可实现一致性。
- Long-sequence support:支持最多 100 帧的故事可视化。
- Flexible styles:支持包括漫画、电影、写实等多种输出风格。
- ControlNet integration:支持 openPose 骨架作为控制信号,以精确调整角色姿势。
- Fast execution:包含快速版本(通过 LCM),可在约 20 分钟内完成 100 帧故事的 10 次迭代。