InternRobotics/PointLLM

[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds

解决的问题

PointLLM 解决了使大型语言模型(LLM)理解 3D 彩色点云的挑战。它使模型能够在不受模糊深度、遮挡或视角依赖性等问题影响的情况下,感知物体类型、几何结构和外观。

工作原理

PointLLM 使用点编码器从输入点云中提取特征,并将其投影到 LLM 主干的潜在空间中。随后,LLM 将这些点令牌与文本令牌一起处理,生成描述性或分类性的文本输出。该模型在包含 66 万条简单和 7 万条复杂点-文本指令对的新数据集上,采用两阶段策略进行训练。

适用人群

本项目专为从事 3D 计算机视觉、机器人学和多模态 AI 的研究人员和开发者设计,适用于需要将 LLM 的推理能力与 3D 空间理解相结合的用户。

主要亮点

  • 多模态 3D 理解:能够理解彩色点云,用于物体分类和描述生成。
  • 大规模指令数据集:包含 73 万条点-文本指令对,以促进训练。
  • 全面的基准测试:建立了生成式 3D 物体分类和 3D 物体描述生成的基准。
  • 灵活的评估方式:支持传统指标评估和基于 LLM 的评估(ChatGPT/GPT-4)。
  • 即用型检查点:提供 7B 和 13B 参数版本的预训练权重。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch