UCSC-VLAA/story-iter

[ICLR 2026] A Training-free Iterative Framework for Long Story Visualization

What it solves

Story-Iter 解決了在為故事(最多 100 幀)生成長序列圖像時,保持語意一致性與高品質交互的困難。傳統的文字轉圖像模型往往難以在多幀中保持角色與場景的一致性,除非進行昂貴的訓練或依賴少量固定參考圖像。

How it works

它使用一種無需訓練的迭代範式,超越了擴散模型的標準去噪步驟。流程分為多輪進行:

  1. Initialization:首先僅根據故事的文字提示生成一組初始圖像。
  2. Iteration:在每個後續輪次中,使用前一輪的所有圖像作為參考。
  3. Global Reference Cross-Attention (GRCA):在 Stable Diffusion 中插入即插即用的模組,利用全域嵌入聚合所有參考幀的資訊,確保整個序列的視覺語境得以保持。

Who it’s for

此工具設計給創作者與研究者,適用於自動化故事視覺化、漫畫生成,或需要角色與場景一致性的長篇視覺敘事。

Highlights

  • Training-free:不需要額外的模型訓練即可實現一致性。
  • Long-sequence support:支援最多 100 幀的故事視覺化。
  • Flexible styles:支援包括漫畫、電影、寫實等多種輸出風格。
  • ControlNet integration:支援 openPose 骨架作為控制訊號,以精確調整角色姿勢。
  • Fast execution:包含快速版本(透過 LCM),可在約 20 分鐘內完成 100 幀故事的 10 次迭代。