AlayaLab/Evoke

Official implementation of EVOKE: Endless Interactive World with Bounded State and Long-Horizon Supervision. A three-step, CFG-free interactive world model. SOTA on WBench.

해결하는 문제

EVOKE는 창문 기반 생성에서 흔히 발생하는 메모리 및 품질 저하를 피하는 고품질, 장기 예측 동영상을 생성하기 위해 설계된 월드 모델입니다. 외부 세계 상태 백업을 사용하여 장면의 기하학 정보를 저장함으로써 '메모리 한계' 문제를 해결하며, 디노이저의 계산 및 메모리 요구량을 증가시키지 않고 거의 무한한 롤아웃이 가능합니다.

작동 방식

EVOKE는 3단계의 CFG 프리(Classifier-Free Guidance) 추론 프로세스를 사용하여 비디오 청크를 자기회귀적으로 생성합니다. 생성된 청크에서 깊이를 추정하고 이를 백업에 역투영함으로써 '세계 상태 백업'에 지속적인 포인트 클라우드를 유지합니다. 새로운 프레임을 생성할 때, 현재 카메라 자세에 따라 이 백업에서 읽어들여 필요한 시각 정보만을 가져와 왜곡합니다. 이 과정은 장기, 중기, 단기 메모리의 다층 메모리 시스템과 효율적인 소수 단계 생성을 가능하게 하는 전용 교사-학생 증류 파이프라인에 의해 지원됩니다.

대상 사용자

이 프로젝트는 월드 모델, 장시간 비디오 생성, 카메라 제어 가능한 합성 환경에 종사하는 AI 연구자 및 개발자에게 적합합니다.

주요 특징

  • 무한한 생성: 카메라 인덱스 기반의 세계 상태 백업을 사용하여 세션 길이에 관계없이 컨텍스트를 제한합니다.
  • 고효율: 단일 H200 GPU에서 3단계, CFG 0으로 2.11초당 1.5초의 비디오를 생성합니다.
  • 비행 중 리프롬프팅: 롤아웃 중에 텍스트 프롬프트를 변경할 수 있으며, 재시작이나 비디오 자르기 없이 가능합니다.
  • 카메라 제어: 전용 Director Web UI를 통해 정밀한 카메라 이동 및 회전을 지원합니다.
  • 유연한 조건부 입력: 텍스트-비디오(t2v), 이미지-비디오(i2v), 비디오-비디오(v2v) 모드를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트