microsoft/LatentSpatialMemory
Latent Spatial Memory for Video World Models
해결하는 문제
이 프로젝트는 명시적 3D 캐시에 의존하는 비디오 세계 모델의 비효율성과 불일치 문제를 해결합니다. 기존 방법은 종종 장면 콘텐츠의 반복적인 RGB 렌더링과 재인코딩을 필요로 하며, 이는 계산 비용이 많이 들고 메모리 집약적입니다.
작동 방식
Latent Spatial Memory는 지속적인 3D 장면 콘텐츠를 RGB 이미지가 아닌 잠재 토큰으로 직접 저장합니다. 초기 관찰에서 지속적인 잠재 캐시를 구축하며, 생성되는 각 비디오 청크에 대해 타겟 뷰 메모리를 읽고, 노이즈 제거 과정에서 이를 사용하며, 업데이트된 정적 장면 콘텐츠를 다시 캐시에 기록합니다.
대상 독자
비디오 세계 모델, 3D 장면 생성 및 비디오 합성에서 효율적인 공간 일관성을 연구하는 연구원 및 개발자.
하이라이트
- 잠재 메모리: 지속적인 3D 장면 컨텍스트를 잠재 공간에서 직접 유지합니다.
- RGB 우회 없음: 반복적인 렌더링 및 재인코딩 주기의 필요성을 제거합니다.
- 메모리 수명 주기: 생성된 청크에 걸쳐 초기화, 읽기, 노이즈 제거 및 업데이트의 전체 주기를 구현합니다.
- 효율성: 훨씬 더 빠른 생성 속도(10.57배)와 대폭 감소된 3D 캐시 메모리 사용량(55배 감소)을 달성합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트