google-deepmind/representations4d
Foundation models for 4D spatial and temporal vision tasks.
解决的问题
本仓库提供了一系列先进的视频和视觉表示方法,旨在提升AI模型对空间(3D)和时间(1D)维度的理解能力——统称为4D表示。它解决了在相机位姿估计、对象跟踪和深度估计等非语义任务中,自监督学习的可扩展性挑战。
如何工作
该项目实现了多种不同的视频表示学习架构方法:
- 扩展4D表示:使用基于Transformer的视频模型与掩码自编码(MAE)相结合,提升空间-时间任务的性能。
- 离格移动(MooG):采用交叉注意力和位置嵌入,使潜在令牌可在空间和时间中自由移动,而非被固定在像素网格上,从而实现更优的对象中心跟踪。
- 递归视频掩码自编码器(RVM):一种基于递归Transformer的方法,采用非对称掩码目标和像素重建损失,实现视频表示学习中的高参数效率。
- 全知视觉编码器:为DINOv2等模型提供一种后训练配方,用于对齐同一场景的不同感官视图(如RGB和深度图)之间的特征。
- GenCeption:将预训练的视频生成扩散骨干(WAN 2.1)转换为前馈感知模型,通过文本指令执行多种视觉任务。
适用人群
适用于从事计算机视觉、视频理解及3D场景重建的研究人员和开发者,他们需要高性能、自监督的编码器和骨干网络,用于下游的空间-时间任务。
主要亮点
- 大规模扩展:展示了自监督视频模型从20M到22B参数的扩展能力。
- 对象中心跟踪:MooG允许令牌绑定到有意义的对象,而非像素。
- 参数效率高:RVM在不使用蒸馏的情况下,相比其他模型参数效率最高可达30倍。
- 通用感知能力:GenCeption使单一模型可通过文本提示处理深度、表面法线和相机位姿估计。
相关
- 项目
- 项目
- 项目
- 项目