facebookresearch/VLM3
Official implementation of paper "VLM³: Vision Language Models Are Native 3D Learners".
解决的问题
VLM³ 解决了 3D 视觉任务的复杂性。传统上,实现 3D 理解的高性能需要专用架构、复杂的损失函数以及大量的数据增强。VLM³ 证明了标准视觉语言模型(VLM)无需这些特殊附加组件即可有效执行这些任务。
工作原理
该项目使用标准 VLM 架构(具体基于 Qwen3-vl-4B)并通过监督微调(SFT)在统一的文本输出域中进行训练。为处理 3D 任务,采用了两种关键技术:
- 焦距归一化:将输入图像进行缩放,使所有图像的焦距保持一致,从而在无需额外编码器的情况下消除相机模糊性。
- 归一化坐标引用:模型使用基于文本的归一化坐标(例如 [0, 2000) 或 [0, 1000))来引用物体或像素,从而无需标记渲染或架构更改。
适用人群
专为从事 3D 视觉、深度估计和相机位姿估计的研究人员和开发者设计,希望使用基础模型以更可扩展、更简单的方式进行 3D 学习。
主要亮点
- 无需架构变更:无需自定义预测头或路由机制,可直接使用标准 VLM 架构和损失函数。
- 高性能:在度量深度估计、像素对应和相机位姿估计方面,性能达到或超越当前最先进模型。
- 简化流程:无需复杂的图像增强操作,如旋转、平移或外观增强。
- 统一输出:使用简单的文本输出实现 3D 空间推理。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch