lukasHoel/video_to_world
Our method reconstructs 3D worlds from video diffusion models using non-rigid alignment to resolve inherent 3D inconsistencies in the generated sequences.
解決する問題
このプロジェクトは、動画拡散モデルによって生成された動画における3Dの不整合性の問題に対処します。これらのモデルは視覚的に印象的な動画を生成できますが、幾何学的な一貫性に欠けていることが多く、それらから安定した3D世界を再構築することが困難です。このツールは非剛体アライメントを使用してこれらの不整合を解決し、整合性のある3D再構築を実現します。
動作方法
システムは、動画を3Dシーンに変換するためのマルチステージパイプラインに従います。
- 前処理: 入力動画から各フレームの点群を推定するために DepthAnything-3 を使用します。
- 非剛体アライメント: 反復的な Frame-to-model ICP(反復最近接点)プロセスを用いて、一貫性のない各フレームの点群を1つの基準フレームにアライメントし、変形場を作成します。
- グローバル最適化: 各フレームの変形を同時に最適化し、結果として得られる基準点群を明確にします。
- 逆変形学習: 基準空間の点を各フレームのカメラ空間にマッピングするネットワークを学習します。
- ガウススプラッティング: 基準点群に基づいて2Dまたは3Dガウススプラッティング(GS)シーンを最適化し、逆変形ネットワークを用いてトレーニング中にフレーム固有のワーピングを処理します。
対象ユーザー
AI生成動画、3D再構築、コンピュータビジョンに取り組む研究者や開発者で、一貫性のない動画拡散出力を安定した3D環境に変換したい人向けです。
特徴
- 不整合の対処: 動画拡散モデルに内在する幾何学的「ドリフト」や不整合を特に設計された方法で修正します。
- 柔軟なレンダリング: 最終シーン表現に2Dおよび3Dガウススプラッティングの両方をサポートします。
- エンドツーエンドパイプライン: 原始のMP4入力から最終的な3D PLYエクスポートまたはインタラクティブな可視化までを一貫したワークフローで提供します。
- 統合性: 深度推定には DepthAnything-3、レンダリングには gsplat といった最先端ツールを活用しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト