InternRobotics/PointLLM
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds
解決的問題
PointLLM 解決了讓大型語言模型(LLM)理解 3D 彩色點雲的挑戰。它使模型能在不受模糊深度、遮擋或視角依賴性等問題影響的情況下,感知物體類型、幾何結構與外觀。
工作原理
PointLLM 使用點編碼器從輸入點雲中提取特徵,並投影至 LLM 主幹的潛在空間中。隨後,LLM 將這些點令牌與文字令牌一起處理,產生描述性或分類性的文字輸出。該模型在包含 66 萬筆簡單與 7 萬筆複雜點-文字指令對的新資料集上,採用兩階段策略進行訓練。
適用對象
本專案專為從事 3D 電腦視覺、機器人學與多模態 AI 的研究人員與開發者設計,適用於需要將 LLM 的推理能力與 3D 空間理解結合的使用者。
主要亮點
- 多模態 3D 理解:能夠理解彩色點雲,用於物體分類與描述生成。
- 大規模指令資料集:包含 73 萬筆點-文字指令對,以促進訓練。
- 全面的基準測試:建立生成式 3D 物體分類與 3D 物體描述生成的基準。
- 彈性評估方式:支援傳統指標評估與基於 LLM 的評估(ChatGPT/GPT-4)。
- 即用型檢查點:提供 7B 與 13B 參數版本的預訓練權重。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch