vita-epfl/Stable-Video-Infinity
[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling
解決的問題
Stable Video Infinity (SVI) 解決了 AI 模型在生成短影片時的限制,能夠創建任意長度(潛在無限)的影片,同時保持高時間一致性、合理的場景轉換以及可控的故事情節,且不會隨時間推移而出現品質下降或「遺忘」現象。
運作原理
SVI 採用混合因果關係方法:它在單個影片片段內使用雙向注意力機制以確保高視覺品質,然後使用片段間的因果關係將這些片段順序連接起來。該系統實現為基於 Wan 2.1 和 Wan 2.2 等基礎模型微調的 LoRA 適配器,僅需極少的訓練數據即可實現長距離生成能力。
適用對象
它專為需要製作長篇 AI 影片內容的創作者、電影製作人和動畫師而設計,例如短片、單場景動畫或敘事影片,在這些場景中,跨越數分鐘的連續性至關重要。
特色亮點
- 無限長度:對持續時間沒有內在限制,能夠製作長達 10 分鐘或更長時間的影片。
- 高一致性:保持視覺穩定性,防止長序列中的色彩漂移或內容退化。
- 多功能生成:支援多場景電影、單場景動畫和條件生成(骨架或音訊)。
- 高效訓練:使用 LoRA 適配器,讓使用者能以極少的數據輕鬆建立自己的 SVI 變體。
- 開源:提供開放的訓練腳本、評估工具和數據集。
相關
- 專案
- 專案
- 專案
- 專案