Pointcept/Concerto

[NeurIPS'25] Official repository of Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

何を解決するか

Concerto は、2D と 3D の同時自己教師付き事前学習を用いて、3D ポイントクラウドの高品質な空間表現を学ぶ方法を提供します。大規模なラベル付き 3D データを必要とせずに、さまざまな下流の 3D パーセプションタスクに効果的に使用できる堅牢な 3D エンコーダーを構築するという課題に対処します。

仕組み

Concerto は Point Transformer V3 (PTv3) アーキテクチャに基づいています。Sonata フレームワークから変更された自己教師付き学習アプローチを用いて、2D および 3D データの両方でモデルを事前学習します。得られたエンコーダー専用モデルは、3D ポイントクラウド(座標、色、法線を含む)から特徴を抽出し、それらの特徴を元のポイントクラウドスケールに戻して下流タスクに利用できます。

対象ユーザー

このプロジェクトは、3D コンピュータビジョン、ポイントクラウド解析、空間表現学習に取り組む研究者および開発者向けに設計されています。

特徴

  • 2D-3D 連合事前学習: 両モダリティを活用して、より優れた空間表現を獲得します。
  • 複数のモデルサイズ: 小型(39M)、ベース(108M)、大型(208M)のモデルに対応する事前学習済み重みを提供します。
  • 柔軟な入力: 色や法線情報を含むか、含まないかに関わらずポイントクラウドをサポートします。
  • 統合された可視化: PCA 可視化、類似度ヒートマップ、セマンティックセグメンテーションの線形プロービング用のデモを内蔵しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト