UCSC-VLAA/story-iter
[ICLR 2026] A Training-free Iterative Framework for Long Story Visualization
What it solves
Story-Iter は、ストーリー(最大 100 フレーム)向けに長い画像シーケンスを生成する際に、意味的一貫性と高品質なインタラクションを維持することの難しさを解決します。従来のテキスト‑ツー‑イメージモデルは、費用のかかるトレーニングや少数の固定リファレンス画像に依存せずに、多数のフレームでキャラクターや設定を一貫させるのが困難です。
How it works
トレーニング不要の反復パラダイムを使用し、拡散モデルの標準的なデノイジングステップを超えます。プロセスはラウンドで進行します:
- Initialization:まず、ストーリーのテキストプロンプトだけに基づいて初期画像セットを生成します。
- Iteration:その後の各ラウンドでは、前ラウンドのすべての画像をリファレンスとして使用します。
- Global Reference Cross-Attention (GRCA):Stable Diffusion にプラグアンドプレイモジュールを挿入し、グローバル埋め込みを用いてすべてのリファレンスフレームから情報を集約し、シーケンス全体で視覚的コンテキストが維持されるようにします。
Who it’s for
このツールは、ストーリーの自動可視化、コミック生成、またはキャラクターとシーンの一貫性が重要な長編ビジュアルナラティブに関心のあるクリエイターや研究者向けに設計されています。
Highlights
- Training-free:一貫性を実現するために追加のモデル学習は不要です。
- Long-sequence support:最大 100 フレームのストーリーを可視化可能です。
- Flexible styles:コミック、映画、リアリスティックなど、さまざまな出力スタイルに対応します。
- ControlNet integration:正確なキャラクターポーズのために openPose スケルトンを制御信号としてサポートします。
- Fast execution:高速バージョン(LCM 経由)を含み、100 フレームのストーリーを約 20 分で 10 回の反復処理できます。