InternRobotics/PointLLM
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds
解决的问题
PointLLM 解决了使大型语言模型(LLM)理解 3D 彩色点云的挑战。它使模型能够在不受模糊深度、遮挡或视角依赖性等问题影响的情况下,感知物体类型、几何结构和外观。
工作原理
PointLLM 使用点编码器从输入点云中提取特征,并将其投影到 LLM 主干的潜在空间中。随后,LLM 将这些点令牌与文本令牌一起处理,生成描述性或分类性的文本输出。该模型在包含 66 万条简单和 7 万条复杂点-文本指令对的新数据集上,采用两阶段策略进行训练。
适用人群
本项目专为从事 3D 计算机视觉、机器人学和多模态 AI 的研究人员和开发者设计,适用于需要将 LLM 的推理能力与 3D 空间理解相结合的用户。
主要亮点
- 多模态 3D 理解:能够理解彩色点云,用于物体分类和描述生成。
- 大规模指令数据集:包含 73 万条点-文本指令对,以促进训练。
- 全面的基准测试:建立了生成式 3D 物体分类和 3D 物体描述生成的基准。
- 灵活的评估方式:支持传统指标评估和基于 LLM 的评估(ChatGPT/GPT-4)。
- 即用型检查点:提供 7B 和 13B 参数版本的预训练权重。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch