facebookresearch/vggt-omega
[CVPR 2026 Oral] VGGT Omega
解决的问题
VGGT-Ω 提供了一种从一组图像中估计相机位姿和深度的方法,从而能够从二维视觉数据重建三维场景。
工作原理
该项目使用一个预训练的基于 Transformer 的模型(提供 1B 参数版本),以图像作为输入,预测姿态编码、深度图和深度置信度。这些预测结果随后被转换为相机外参和内参,生成三维点云并以 GLB 文件形式可视化场景。
适用人群
专为从事计算机视觉、三维重建和空间人工智能的研究人员和开发者设计。
主要亮点
- 端到端推理:从图像中同时预测相机参数和深度。
- 文本对齐支持:提供专门用于文本对齐嵌入的检查点。
- 三维可视化:包含一个 Gradio 演示,可将未反投影的点云和预测的相机可视化为 GLB 场景。
- 可扩展的内存使用:提供处理不同数量输入帧时的 GPU 内存使用详细基准。
相关
- 项目
- 项目
- 项目
- 项目
- 项目