AlayaLab/Evoke

Official implementation of EVOKE: Endless Interactive World with Bounded State and Long-Horizon Supervision. A three-step, CFG-free interactive world model. SOTA on WBench.

解决的问题

EVOKE 是一种世界模型,旨在生成高质量、长时程的视频,避免窗口化生成中常见的内存和质量退化问题。它通过使用外部世界状态银行来存储场景几何信息,解决了「内存天花板」问题,从而在不增加去噪器计算或内存需求的情况下,实现近乎无限的滚动生成。

工作原理

EVOKE 采用三步、无 CFG(无分类器引导)的推理流程,自回归地生成视频片段。它通过从生成的片段中估计深度,并将这些信息反投影到「世界状态银行」中,从而在银行中维持一个持久的点云。在生成新帧时,模型根据当前相机姿态从该银行中读取数据,仅检索并扭曲必要的视觉信息。该过程由多层级记忆系统(长、中、短期)和专用的教师-学生蒸馏流水线支持,实现高效、少步数的生成。

适用人群

本项目适用于从事世界模型、长视频生成和可相机控制的合成环境的 AI 研究人员与开发者。

主要亮点

  • 无限生成:使用基于相机索引的世界状态银行,无论会话时长如何,都能保持上下文边界。
  • 高效率:在单个 H200 GPU 上,仅用 3 步、零 CFG,每 2.11 秒生成 1.5 秒视频。
  • 飞行中重提示:在滚动生成过程中可更改文本提示,无需重启或剪辑视频。
  • 相机控制:通过专用的 Director Web UI 支持精确的相机移动与旋转。
  • 灵活的条件输入:支持文本到视频(t2v)、图像到视频(i2v)和视频到视频(v2v)模式。

相关

  • 项目
  • 项目
  • 项目
  • 项目