microsoft/LatentSpatialMemory
Latent Spatial Memory for Video World Models
解決的問題
本專案解決了依賴顯式 3D 快取的視訊世界模型效率不彰與不一致的問題。傳統方法通常需要對場景內容進行重複的 RGB 渲染與重新編碼,這在運算上非常昂貴且耗費記憶體。
運作原理
Latent Spatial Memory 將持續性的 3D 場景內容直接儲存為潛在表示,而非 RGB 影像。它從初始觀察中建立持續性的潛在快取,並且對於每個生成的視訊片段,讀取目標視角的記憶體,在去噪過程中使用它,然後將更新後的靜態場景內容寫回快取。
適用對象
從事視訊世界模型、3D 場景生成以及視訊合成中高效空間一致性研究的研究人員與開發者。
亮點
- 潛在記憶體:直接在潛在空間中維護持續性的 3D 場景上下文。
- 無 RGB 繞道:消除了重複渲染與重新編碼循環的需求。
- 記憶體生命週期:在生成的視訊片段間實現初始化、讀取、去噪與更新的完整循環。
- 效率:實現顯著更快的生成速度(10.57倍)與大幅降低的 3D 快取記憶體使用量(降低 55 倍)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案