facebookresearch/boxer

Code for the Boxer research paper

解决的问题

Boxer 解决了在开放世界环境下,将图像中的 2D 对象检测(边界框)准确地“提升”为 3D 方向边界框(OBB)的挑战。它特别聚焦于室内对象检测,仅需使用带姿态的图像和半稠密点云,即可在 3D 空间中识别对象。

工作原理

Boxer 采用结合 2D 检测与 3D 估计的流水线。它利用 OWLv2 实现开放词汇的 2D 检测(允许用户通过文本提示来指定特定对象),并使用名为 BoxerNet 的模型将这些 2D 框提升至 3D。该系统可处理单张图像或视频序列,利用相机内参、6 自由度姿态和重力方向,正确对齐边界框。它还支持在线 3D 跟踪以保持帧间的时间一致性,以及离线 3D 融合,将多个检测结果合并为单一全局 3D 表示。

适用人群

本工具专为从事计算机视觉、机器人和室内场景理解的研究人员与开发者设计,适用于需要将 2D 图像检测结果转换为空间上精确的 3D 对象位置与朝向的场景。

主要亮点

  • 开放词汇检测:集成 OWLv2,支持基于任意文本提示的对象检测。
  • 鲁棒的 3D 提升:将 2D 边界框转换为 3D 方向边界框(OBB)。
  • 时间一致性:包含在线跟踪器,以在视频帧间保持对象身份一致。
  • 全局融合:支持后处理融合,将多视角检测结果合并为静态全局地图。
  • 广泛的数据集支持:兼容 Project Aria、CA-1M、SUN-RGBD 和 ScanNet 数据。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目