InternRobotics/PointLLM

[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds

解決的問題

PointLLM 解決了讓大型語言模型(LLM)理解 3D 彩色點雲的挑戰。它使模型能在不受模糊深度、遮擋或視角依賴性等問題影響的情況下,感知物體類型、幾何結構與外觀。

工作原理

PointLLM 使用點編碼器從輸入點雲中提取特徵,並投影至 LLM 主幹的潛在空間中。隨後,LLM 將這些點令牌與文字令牌一起處理,產生描述性或分類性的文字輸出。該模型在包含 66 萬筆簡單與 7 萬筆複雜點-文字指令對的新資料集上,採用兩階段策略進行訓練。

適用對象

本專案專為從事 3D 電腦視覺、機器人學與多模態 AI 的研究人員與開發者設計,適用於需要將 LLM 的推理能力與 3D 空間理解結合的使用者。

主要亮點

  • 多模態 3D 理解:能夠理解彩色點雲,用於物體分類與描述生成。
  • 大規模指令資料集:包含 73 萬筆點-文字指令對,以促進訓練。
  • 全面的基準測試:建立生成式 3D 物體分類與 3D 物體描述生成的基準。
  • 彈性評估方式:支援傳統指標評估與基於 LLM 的評估(ChatGPT/GPT-4)。
  • 即用型檢查點:提供 7B 與 13B 參數版本的預訓練權重。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch