UCSC-VLAA/story-iter
[ICLR 2026] A Training-free Iterative Framework for Long Story Visualization
What it solves
Story-Iter 解決了在為故事(最多 100 幀)生成長序列圖像時,保持語意一致性與高品質交互的困難。傳統的文字轉圖像模型往往難以在多幀中保持角色與場景的一致性,除非進行昂貴的訓練或依賴少量固定參考圖像。
How it works
它使用一種無需訓練的迭代範式,超越了擴散模型的標準去噪步驟。流程分為多輪進行:
- Initialization:首先僅根據故事的文字提示生成一組初始圖像。
- Iteration:在每個後續輪次中,使用前一輪的所有圖像作為參考。
- Global Reference Cross-Attention (GRCA):在 Stable Diffusion 中插入即插即用的模組,利用全域嵌入聚合所有參考幀的資訊,確保整個序列的視覺語境得以保持。
Who it’s for
此工具設計給創作者與研究者,適用於自動化故事視覺化、漫畫生成,或需要角色與場景一致性的長篇視覺敘事。
Highlights
- Training-free:不需要額外的模型訓練即可實現一致性。
- Long-sequence support:支援最多 100 幀的故事視覺化。
- Flexible styles:支援包括漫畫、電影、寫實等多種輸出風格。
- ControlNet integration:支援 openPose 骨架作為控制訊號,以精確調整角色姿勢。
- Fast execution:包含快速版本(透過 LCM),可在約 20 分鐘內完成 100 幀故事的 10 次迭代。