D4RT:动态4D重建与跟踪
Google DeepMind推出了D4RT(动态4D重建与跟踪),这是一个统一的AI模型,旨在从2D视频输入中跨空间和时间重建并跟踪动态场景。通过将动态场景重建统一到一个框架中,D4RT实现了对动态现实的全面感知,克服了以往恢复运动中的3D体积世界所需的碎片化和计算密集型流程。
统一的查询架构
D4RT利用统一的编码器-解码器Transformer架构,解决了从2D投影恢复3D运动的逆问题。该系统通过灵活的查询机制运作,允许模型仅基于一个基本问题计算必要的数据:“视频中的给定像素在任意时间、从选定相机视角观察时,在3D空间中的位置在哪里?”
关键组件包括:
- 编码器:将输入视频处理为场景几何和运动的压缩表示。
- 轻量级解码器:在现代AI硬件上并行查询编码器的表示,以回答特定的时空查询。
这种方法使D4RT具有极高的可扩展性和速度,无论是跟踪单个点还是重建整个场景。
性能与基准测试
D4RT在准确性和效率上均显著优于以往的最先进方法,在某些测试中速度提升18倍至300倍。例如,在一个测试中,D4RT在单个TPU芯片上处理一分钟的视频仅需约5秒,而以往方法需要10分钟(提升120倍)。
在多个基准测试中,D4RT取得了领先结果:
- 点云重建(MPI Sintel):D4RT的3D保真度得分为1.091,优于基线方法如$\pi3$(0.861)和SpatialTrackerV2(0.625)。
- 3D点跟踪(Aria Digital Twin):D4RT的3D保真度得分为1.904,超越了SpatialTrackerV2(1.762)和CoTracker3 + VGGT(1.264)。
- 相机位姿估计(RE10k):D4RT的位姿AUC得分最高,为0.835,超过了$\pi3$(0.787)和SpatialTrackerV2(0.757)。
核心能力
通过其灵活的基于查询的接口,D4RT可以解决各种4D任务,而无需专门的模型:
- 点跟踪:预测像素在时间上的3D轨迹,即使对象并非在每一帧中都可见。
- 点云重建:通过冻结时间和相机视角,生成场景的完整3D结构,无需迭代优化或单独的相机估计。
- 相机位姿估计:通过对齐不同视角下同一时刻的3D快照,恢复相机的运动轨迹。
下游应用
DeepMind确定了D4RT实时4D重建能力可应用的三个主要领域:
- 机器人技术:在存在移动人物和物体的环境中,提供安全导航和灵巧操作所需的空间感知能力。
- 增强现实(AR):实现对场景几何的低延迟、设备端理解,从而将数字对象准确叠加到现实世界中。
- 世界模型:通过分离相机运动、物体运动和静态几何,助力开发具备真实世界模型的人工智能。
Sources
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch