AlayaLab/Evoke

Official implementation of EVOKE: Endless Interactive World with Bounded State and Long-Horizon Supervision. A three-step, CFG-free interactive world model. SOTA on WBench.

解決的問題

EVOKE 是一種世界模型,旨在生成高品質、長時程的影片,避免窗口化生成中常見的記憶體與品質退化問題。它透過使用外部世界狀態銀行來儲存場景幾何資訊,解決了「記憶體天花板」問題,進而能在不增加去噪器的運算或記憶體需求的情況下,實現近乎無限的滾動生成。

工作原理

EVOKE 採用三步驟、無 CFG(無分類器引導)的推論流程,自回歸地生成影片片段。它透過從產生的片段中估計深度,並將這些資訊反投影至「世界狀態銀行」中,從而於銀行中維持一個持續的點雲。在產生新畫格時,模型根據目前的相機姿態從該銀行中讀取資料,僅擷取並扭曲必要的視覺資訊。此過程由多層級記憶系統(長、中、短期)與專用的教師-學生蒸餾流程支援,實現高效、少步數的生成。

適用對象

本專案適用於從事世界模型、長影片生成與可相機控制的合成環境的 AI 研究人員與開發者。

主要亮點

  • 無限生成:使用基於相機索引的世界狀態銀行,無論會話長度如何,都能保持上下文邊界。
  • 高效率:在單一 H200 GPU 上,僅用 3 步、零 CFG,每 2.11 秒生成 1.5 秒影片。
  • 飛行中重提示:在滾動生成過程中可更換文字提示,無需重新啟動或剪輯影片。
  • 相機控制:透過專用的 Director Web UI 支援精確的相機移動與旋轉。
  • 靈活的條件輸入:支援文字到影片(t2v)、影像到影片(i2v)與影片到影片(v2v)模式。

相關

  • 專案
  • 專案
  • 專案
  • 專案