InternRobotics/PointLLM

[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds

何を解決するか

PointLLMは、大規模言語モデル(LLM)が3Dカラーポイントクラウドを理解できるようにする挑戦に応える。モデルが曖昧な深度、隠蔽、視点依存性といった問題に左右されず、物体の種類、幾何学的構造、外観を認識できるようにする。

動作方法

PointLLMは、入力されたポイントクラウドから特徴を抽出し、LLMのバックボーンの潜在空間に投影するポイントエンコーダを使用する。その後、LLMはこれらのポイントトークンとテキストトークンを併用して、記述的または分類的なテキスト出力を生成する。このモデルは、66万件のシンプルなおよび7万件の複雑なポイント-テキストインストラクションペアからなる新しいデータセット上で、2段階の戦略で訓練されている。

対象ユーザー

このプロジェクトは、3Dコンピュータビジョン、ロボティクス、マルチモーダルAIに取り組む研究者や開発者向けに設計されており、LLMの推論能力と3D空間理解を統合する必要がある人を対象としている。

主な特徴

  • マルチモーダル3D理解: 物体分類およびキャプション生成のためのカラーポイントクラウドを理解できる。
  • 大規模なインストラクションデータセット: 訓練を促進するための73万件のポイント-テキストインストラクションペアを含むデータセット。
  • 包括的なベンチマーク: 生成型3D物体分類および3D物体キャプションのためのベンチマークを確立。
  • 柔軟な評価: 伝統的なメトリクスとLLMベースの評価(ChatGPT/GPT-4)の両方をサポート。
  • 即時利用可能なチェックポイント: 7Bおよび13Bパラメータバージョンの事前学習済み重みを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch