lukasHoel/video_to_world
Our method reconstructs 3D worlds from video diffusion models using non-rigid alignment to resolve inherent 3D inconsistencies in the generated sequences.
解決的問題
本專案解決由影片擴散模型生成的影片中出現的3D不一致性問題。雖然這些模型能產生視覺上令人印象深刻的序列,但通常缺乏幾何一致性,使得從中重建穩定的3D世界變得困難。此工具透過非剛性對齊來解決這些不一致性,進而創建出一致的3D重構結果。
工作原理
該系統遵循多階段流程,將影片轉換為3D場景:
- 預處理:使用 DepthAnything-3 從輸入影片中估計每幀的點雲。
- 非剛性對齊:採用迭代的 Frame-to-model ICP(迭代最近點)過程,將這些不一致的每幀點雲對齊至單一基準幀,產生形變場。
- 全域最佳化:共同優化所有幀的形變,以強化最終基準點雲的清晰度。
- 逆形變訓練:訓練一個網路,將基準空間中的點映射回每幀的相機空間。
- 高斯點繪:基於基準點雲優化2D或3D高斯點繪(GS)場景,並使用逆形變網路在訓練過程中處理每幀特有的形變。
適用對象
從事AI生成影片、3D重構與電腦視覺的研究人員與開發者,希望將不一致的影片擴散輸出轉換為穩定3D環境的人群。
主要亮點
- 處理不一致性:專門設計用於修復影片擴散模型固有的幾何「漂移」與不一致性問題。
- 靈活渲染:支援最終場景表示的2D與3D高斯點繪。
- 端到端流程:提供從原始MP4輸入到最終3D PLY匯出或互動式視覺化的一整套工作流程。
- 整合性:利用最先進的工具,如 DepthAnything-3 進行深度估計,以及 gsplat 進行渲染。
相關
- 專案
- 專案
- 專案
- 專案