InternRobotics/PointLLM
[ECCV 2024 Best Paper Candidate & TPAMI 2025] PointLLM: Empowering Large Language Models to Understand Point Clouds
何を解決するか
PointLLMは、大規模言語モデル(LLM)が3Dカラーポイントクラウドを理解できるようにする挑戦に応える。モデルが曖昧な深度、隠蔽、視点依存性といった問題に左右されず、物体の種類、幾何学的構造、外観を認識できるようにする。
動作方法
PointLLMは、入力されたポイントクラウドから特徴を抽出し、LLMのバックボーンの潜在空間に投影するポイントエンコーダを使用する。その後、LLMはこれらのポイントトークンとテキストトークンを併用して、記述的または分類的なテキスト出力を生成する。このモデルは、66万件のシンプルなおよび7万件の複雑なポイント-テキストインストラクションペアからなる新しいデータセット上で、2段階の戦略で訓練されている。
対象ユーザー
このプロジェクトは、3Dコンピュータビジョン、ロボティクス、マルチモーダルAIに取り組む研究者や開発者向けに設計されており、LLMの推論能力と3D空間理解を統合する必要がある人を対象としている。
主な特徴
- マルチモーダル3D理解: 物体分類およびキャプション生成のためのカラーポイントクラウドを理解できる。
- 大規模なインストラクションデータセット: 訓練を促進するための73万件のポイント-テキストインストラクションペアを含むデータセット。
- 包括的なベンチマーク: 生成型3D物体分類および3D物体キャプションのためのベンチマークを確立。
- 柔軟な評価: 伝統的なメトリクスとLLMベースの評価(ChatGPT/GPT-4)の両方をサポート。
- 即時利用可能なチェックポイント: 7Bおよび13Bパラメータバージョンの事前学習済み重みを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch