lukasHoel/video_to_world
Our method reconstructs 3D worlds from video diffusion models using non-rigid alignment to resolve inherent 3D inconsistencies in the generated sequences.
해결하는 문제
이 프로젝트는 동영상 확산 모델이 생성한 동영상에서 발생하는 3D 불일치 문제를 해결합니다. 이러한 모델은 시각적으로 인상적인 시퀀스를 생성할 수 있지만, 일반적으로 기하학적 일관성이 부족하여 이를 기반으로 안정적인 3D 세계를 재구성하기 어렵습니다. 이 도구는 비강체 정렬을 사용하여 이러한 불일치를 해결하고 일관된 3D 재구성 결과를 생성합니다.
작동 방식
시스템은 동영상을 3D 장면으로 변환하기 위한 다단계 파이프라인을 따릅니다.
- 전처리: 입력 동영상에서 각 프레임의 포인트 클라우드를 추정하기 위해 DepthAnything-3를 사용합니다.
- 비강체 정렬: 반복적인 Frame-to-model ICP(반복 최근접점) 프로세스를 사용하여 일관되지 않은 각 프레임의 포인트 클라우드를 하나의 기준 프레임에 정렬하고, 변형 필드를 생성합니다.
- 글로벌 최적화: 모든 프레임의 변형을 함께 최적화하여 결과적인 기준 포인트 클라우드를 선명하게 만듭니다.
- 역변형 학습: 기준 공간의 점을 각 프레임의 카메라 공간으로 매핑하는 네트워크를 학습합니다.
- 가우시안 스플래터링: 기준 포인트 클라우드를 기반으로 2D 또는 3D 가우시안 스플래터링(GS) 장면을 최적화하며, 역변형 네트워크를 사용해 학습 중 프레임별 왜곡을 처리합니다.
대상 사용자
AI 생성 동영상, 3D 재구성, 컴퓨터 비전 분야에서 일하는 연구자 및 개발자로, 일관성 없는 동영상 확산 출력을 안정적인 3D 환경으로 전환하고자 하는 사람들을 위한 도구입니다.
주요 특징
- 불일치 처리: 동영상 확산 모델에 내재된 기하학적 '드리프트' 및 불일치를 특별히 설계된 방식으로 수정합니다.
- 유연한 렌더링: 최종 장면 표현에 2D 및 3D 가우시안 스플래터링을 모두 지원합니다.
- 엔드투엔드 파이프라인: 원시 MP4 입력에서 최종 3D PLY 내보내기 또는 인터랙티브 시각화까지 완전한 워크플로우를 제공합니다.
- 통합성: 깊이 추정에는 DepthAnything-3, 렌더링에는 gsplat과 같은 최첨단 도구를 활용합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트