lukasHoel/video_to_world

Our method reconstructs 3D worlds from video diffusion models using non-rigid alignment to resolve inherent 3D inconsistencies in the generated sequences.

解決する問題

このプロジェクトは、動画拡散モデルによって生成された動画における3Dの不整合性の問題に対処します。これらのモデルは視覚的に印象的な動画を生成できますが、幾何学的な一貫性に欠けていることが多く、それらから安定した3D世界を再構築することが困難です。このツールは非剛体アライメントを使用してこれらの不整合を解決し、整合性のある3D再構築を実現します。

動作方法

システムは、動画を3Dシーンに変換するためのマルチステージパイプラインに従います。

  1. 前処理: 入力動画から各フレームの点群を推定するために DepthAnything-3 を使用します。
  2. 非剛体アライメント: 反復的な Frame-to-model ICP(反復最近接点)プロセスを用いて、一貫性のない各フレームの点群を1つの基準フレームにアライメントし、変形場を作成します。
  3. グローバル最適化: 各フレームの変形を同時に最適化し、結果として得られる基準点群を明確にします。
  4. 逆変形学習: 基準空間の点を各フレームのカメラ空間にマッピングするネットワークを学習します。
  5. ガウススプラッティング: 基準点群に基づいて2Dまたは3Dガウススプラッティング(GS)シーンを最適化し、逆変形ネットワークを用いてトレーニング中にフレーム固有のワーピングを処理します。

対象ユーザー

AI生成動画、3D再構築、コンピュータビジョンに取り組む研究者や開発者で、一貫性のない動画拡散出力を安定した3D環境に変換したい人向けです。

特徴

  • 不整合の対処: 動画拡散モデルに内在する幾何学的「ドリフト」や不整合を特に設計された方法で修正します。
  • 柔軟なレンダリング: 最終シーン表現に2Dおよび3Dガウススプラッティングの両方をサポートします。
  • エンドツーエンドパイプライン: 原始のMP4入力から最終的な3D PLYエクスポートまたはインタラクティブな可視化までを一貫したワークフローで提供します。
  • 統合性: 深度推定には DepthAnything-3、レンダリングには gsplat といった最先端ツールを活用しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト