microsoft/LatentSpatialMemory

Latent Spatial Memory for Video World Models

解決する課題

このプロジェクトは、明示的な 3D キャッシュに依存するビデオワールドモデルの非効率性と不整合性を解決します。従来の手法では、シーンコンテンツの RGB レンダリングと再エンコードを繰り返す必要があることが多く、計算コストが高くメモリを大量に消費します。

仕組み

Latent Spatial Memory は、永続的な 3D シーンコンテンツを RGB 画像ではなく、直接潜在トークンとして保存します。初期観測から永続的な潜在キャッシュを構築し、生成される各ビデオチャンクに対して、ターゲットビューのメモリを読み取り、ノイズ除去プロセス中にそれを使用し、更新された静的シーンコンテンツをキャッシュに書き戻します。

対象者

ビデオワールドモデル、3D シーン生成、およびビデオ合成における効率的な空間的一貫性に取り組む研究者や開発者。

ハイライト

  • 潜在メモリ: 永続的な 3D シーンコンテキストを潜在空間で直接維持します。
  • RGBの迂回なし: 繰り返しのレンダリングと再エンコードのサイクルの必要性を排除します。
  • メモリライフサイクル: 生成されたチャンク間で初期化、読み取り、ノイズ除去、更新の完全なサイクルを実装します。
  • 効率性: 顕著に高速な生成速度(10.57倍)と大幅に低い 3D キャッシュメモリ使用量(55倍低減)を実現します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト