facebookresearch/boxer

Code for the Boxer research paper

解決的問題

Boxer 解決了在開放世界環境下,將影像中的 2D 物件檢測(邊界框)準確地「提升」為 3D 方向邊界框(OBB)的挑戰。它特別聚焦於室內物件檢測,僅需使用帶姿態的影像與半稠密點雲,即可在 3D 空間中識別物件。

工作原理

Boxer 採用結合 2D 檢測與 3D 計算的流程。它利用 OWLv2 實現開放詞彙的 2D 檢測(允許使用者透過文字提示指定特定物件),並使用稱為 BoxerNet 的模型將這些 2D 框提升至 3D。該系統可處理單張影像或影片序列,利用相機內參、6 自由度姿態與重力方向,正確對齊邊界框。它還支援線上 3D 追蹤以維持幀間的時間一致性,以及離線 3D 融合,將多個檢測結果合併為單一全域 3D 表示。

適用對象

本工具專為從事電腦視覺、機器人與室內場景理解的研究人員與開發者設計,適用於需要將 2D 影像檢測結果轉換為空間上精確的 3D 物件位置與朝向的場景。

主要亮點

  • 開放詞彙檢測:整合 OWLv2,支援基於任意文字提示的物件檢測。
  • 穩健的 3D 提升:將 2D 邊界框轉換為 3D 方向邊界框(OBB)。
  • 時間一致性:包含線上追蹤器,以在影片幀間保持物件身分一致。
  • 全域融合:支援後處理融合,將多視角檢測結果合併為靜態全域地圖。
  • 廣泛的資料集支援:相容 Project Aria、CA-1M、SUN-RGBD 與 ScanNet 資料。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案